Бюджет: 6000 UAH Срок: 14 дней
Здравствуйте, Анастасия,
Вот как я бы это построил и где я бы оспорил спецификацию.
Предлагаемый стек: Ollama, обслуживающий квантованный открытый модель (Qwen2.5 или Mistral, 7-14B в зависимости от вашего оборудования), Qdrant в качестве векторного хранилища, LlamaIndex для слоя RAG, FastAPI для API, все в Docker Compose за Nginx. Ингестация: PyMuPDF для PDF с Tesseract OCR только на страницах, где это действительно необходимо (OCR на всем — это обычная причина, по которой эти пайплайны работают медленно), python-docx и openpyxl для DOCX/XLSX, Whisper для транскрипций. Удаление дубликатов по хешу содержимого, версионирование по идентификатору документа плюс ревизия, так что повторно загруженный файл заменяет свои старые части вместо удвоения их.
Два момента, которые важнее выбора фреймворка. Цитаты должны возвращаться как данные - идентификаторы частей и исходный файл, разрешенный на этапе извлечения, никогда не запрашиваемые у модели в запросе. Модель, которой сказано цитировать, будет выдумывать цитаты; пайплайн, который их возвращает, не может. А изоляция клиентов должна находиться в фильтре запросов Qdrant, обеспечиваемом для каждого арендатора, а не в коде приложения, где одна пропущенная ветка может утечь документы другого клиента.
Сроки и стоимость, поэтапно, как вы просили:
M1, 14 дней, сумма ставки: LLM, работающий на вашем сервере, ингестация для PDF/OCR/DOCX/TXT/XLSX, индекс Qdrant с удалением дубликатов и версионированием, конечная точка запроса FastAPI, возвращающая цитируемые источники, развертывание Docker и документация по настройке.
M2: агенты встреч - транскрипции, резюме, извлечение действий - плюс веб-интерфейс запроса.
M3: аутентификация и роли, изоляция по клиентам, проверка безопасности, настройка производительности.
Полная оценка M1-M3 22000-28000 UAH. Я предпочитаю фиксированную цену за этап, а не почасовую, чтобы вы получили работающую систему в конце каждого этапа, а не табель учета рабочего времени.
Прямо о портфолио, о котором вы спрашивали: наша оплаченная работа для клиентов - это производственный Python и автоматизация API на Linux VPS - инструмент отчетности Google Ads API, Telegram-боты для живых бизнесов, почтовая инфраструктура. Локальный LLM, RAG и многопользовательская сторона, которую я веду в доме ежедневно, это система агентов с собственным хранилищем документов. Я могу показать это вживую на совместном экране, чтобы вы увидели, как работают извлечение и цитаты, прежде чем что-либо подтверждать.
Один вопрос, который определяет архитектуру: какое CPU, RAM и GPU есть на целевом сервере? Модель 7B на одном только CPU отвечает за 10-20 секунд; на 16GB GPU - менее двух. Без GPU я бы подобрал модель под ваше оборудование и сказал, какое оборудование стоит купить, а не обещал скорость, которую оно не может обеспечить.
Петро Паньков, BotCraft Group