Бюджет: 6000 UAH Термін: 14 днів
Привіт, Анастасіє,
Ось як я б це побудував і де я б заперечив специфікації.
Запропонований стек: Ollama, що обслуговує квантизовану відкриту модель (Qwen2.5 або Mistral, 7-14B залежно від вашого обладнання), Qdrant як векторне сховище, LlamaIndex для шару RAG, FastAPI для API, все в Docker Compose за Nginx. Інтеграція: PyMuPDF для PDF з Tesseract OCR лише на сторінках, які дійсно потребують цього (OCR на всьому є звичайною причиною, чому ці конвеєри повільні), python-docx і openpyxl для DOCX/XLSX, Whisper для транскрипцій. Видалення дублікатів за хешем вмісту, версіонування за ідентифікатором документа плюс ревізія, так що повторно завантажений файл замінює свої старі частини, а не подвоює їх.
Два пункти, які важливіші за вибір фреймворку. Цитати повинні повертатися як дані - ідентифікатори частин і вихідний файл, отримані з етапу вилучення, ніколи не запитуються у моделі в запиті. Модель, якій сказано цитувати, вигадуватиме цитати; конвеєр, який їх повертає, не може. І ізоляція клієнтів повинна бути в фільтрі запиту Qdrant, що забезпечується для кожного орендаря, а не в коді програми, де одна пропущена гілка витікає документи іншого клієнта.
Терміни та вартість, на основі етапів, як ви просили:
M1, 14 днів, сума пропозиції: LLM, що працює на вашому сервері, інтеграція для PDF/OCR/DOCX/TXT/XLSX, індекс Qdrant з видаленням дублікатів і версіонуванням, точка запиту FastAPI, що повертає цитовані джерела, розгортання Docker і документація з налаштування.
M2: агенти зустрічей - транскрипції, резюме, виділення дій - плюс веб-інтерфейс запиту.
M3: авторизація та ролі, ізоляція для кожного клієнта, валідація безпеки, налаштування продуктивності.
Повна оцінка M1-M3 22000-28000 грн. Я віддаю перевагу фіксованій ціні за етап замість погодинної, щоб ви отримали працюючу систему в кінці кожного з них, а не табель обліку робочого часу.
Прямо про портфоліо, яке ви запитували: наша оплачувана робота для клієнтів - це виробничий Python та автоматизація API на Linux VPS - інструмент звітності Google Ads API, Telegram-боти для живих бізнесів, поштової інфраструктури. Локальний LLM, RAG та багатокористувацька сторона, якою я займаюся щодня, - це система агентів, що самостійно хоститься з вилученням з власної бази документів. Я можу показати це в режимі реального часу на спільному екрані, щоб ви побачили, як працюють вилучення та цитати, перш ніж щось зобов'язатися.
Одне питання, яке визначає архітектуру: яке обладнання має цільовий сервер, CPU, RAM та GPU? Модель 7B на одному лише CPU відповідає за 10-20 секунд; на GPU 16 ГБ - менше двох. Без GPU я б підібрав модель до вашого обладнання і сказав би, яке обладнання варто купити, а не обіцяв би швидкість, яку вона не може забезпечити.
Петро Пankov, BotCraft Group