Budżet: 6000 UAH Termin: 14 dni
Cześć Anastazjo,
Oto jak bym to zbudował i gdzie bym się sprzeciwiał specyfikacji.
Proponowany stos: Ollama obsługująca skwantyzowany otwarty model (Qwen2.5 lub Mistral, 7-14B w zależności od twojego sprzętu), Qdrant jako magazyn wektorów, LlamaIndex dla warstwy RAG, FastAPI dla API, wszystko w Docker Compose za Nginx. Ingestia: PyMuPDF dla PDF z Tesseract OCR tylko na stronach, które naprawdę tego potrzebują (OCR na wszystkim to zwykle powód, dla którego te pipeline'y się wleką), python-docx i openpyxl dla DOCX/XLSX, Whisper dla transkryptów. Usuwanie duplikatów według hasha treści, wersjonowanie według id dokumentu plus rewizji, więc ponownie przesłany plik zastępuje swoje stare fragmenty zamiast je podwajać.
Dwa punkty, które mają większe znaczenie niż wybór frameworka. Cytaty muszą być zwracane jako dane - identyfikatory fragmentów i plik źródłowy rozwiązany z kroku pobierania, nigdy nie żądane od modelu w podpowiedzi. Model, któremu powiedziano, aby cytował, wymyśli cytaty; pipeline, który je zwraca, nie może. A izolacja klientów należy do filtra zapytań Qdrant, egzekwowanego na poziomie najemcy, a nie w kodzie aplikacji, gdzie jedno pominięcie gałęzi ujawnia dokumenty innego klienta.
Harmonogram i koszt, oparte na kamieniach milowych, jak prosiłeś:
M1, 14 dni, kwota oferty: LLM działający na twoim serwerze, ingestia dla PDF/OCR/DOCX/TXT/XLSX, indeks Qdrant z usuwaniem duplikatów i wersjonowaniem, punkt końcowy zapytania FastAPI zwracający cytowane źródła, wdrożenie Docker i dokumentacja konfiguracyjna.
M2: agenci spotkań - transkrypty, podsumowania, ekstrakcja zadań - plus interfejs zapytań webowych.
M3: autoryzacja i role, izolacja per klient, walidacja bezpieczeństwa, optymalizacja wydajności.
Całkowity szacunkowy koszt M1-M3 to 22000-28000 UAH. Wolę stałą cenę za kamień milowy niż stawkę godzinową, abyś otrzymał działający system na koniec każdego z nich, a nie arkusz czasu.
Prosto o portfolio, o które pytałeś: nasza płatna praca dla klientów to produkcyjny Python i automatyzacja API na Linux VPS - narzędzie raportujące Google Ads API, boty Telegram dla działających firm, infrastruktura mailowa. Lokalny LLM, RAG i strona wieloagentowa, którą prowadzę wewnętrznie na co dzień, to system agentów hostowany samodzielnie z pobieraniem z własnej bazy dokumentów. Mogę to pokazać na żywo podczas udostępniania ekranu, abyś zobaczył działanie pobierania i cytatów przed podjęciem jakiejkolwiek decyzji.
Jedno pytanie, które decyduje o architekturze: jaki procesor, RAM i GPU ma docelowy serwer? Model 7B działający tylko na CPU odpowiada w 10-20 sekund; na GPU 16GB, poniżej dwóch. Bez GPU dostosowałbym model do twojego sprzętu i powiedziałbym, jaki sprzęt warto kupić, zamiast obiecywać prędkość, której nie może dostarczyć.
Petro Pankov, BotCraft Group