Не вказано
29 ставок
Потрібна система для автоматичної обробки великих обсягів інформації за допомогою ШІ
Зараз я використовую власний промпт у Claude. На невеликих текстах він працює добре, але при великих обсягах нейромережа може пропускати частини, зупинятися раніше кінця або повідомляти про завершення, хоча матеріал оброблений не повністю.
Потрібна система, яка приймає одразу книгу на 200+ сторінок, кілька книг, PDF, DOCX, TXT, субтитри, розшифровки аудіо та відео або інший великий масив інформації і автоматично обробляє його від початку до кінця.
Один з основних форматів результату для кожного смислового речення:
English version.
••••••••••••••••••••••••••••
Russian version.
••••••••••••••••••••••••••••
English version.
••••••••••••••••••••••••••••
English version.
••••••••••••••••••••••••••••
Russian version.
••••••••••••••••••••••••••••
English version.
Кожен смисловий ряд виводиться чотири рази англійською та два рази російською в зазначеній черговості. Переклад має точно передавати сенс. Короткі речення можна об'єднувати, довгі — ділити на закінчені смислові рядки.
Формат має бути налаштовуваним: кількість англійських повторень і перекладів, їх черговість, мови, роздільник, довжина рядків, основний промпт і збереження різних шаблонів. Наприклад, замість English–Russian–English–English–Russian–English можна вибрати будь-яку іншу послідовність.
Якщо документ неможливо обробити одним запитом, програма повинна сама розділити його на внутрішні блоки, надіслати їх у Claude, ChatGPT, Gemini або іншу модель, перевірити результат, повторити проблемні частини і об'єднати все в один файл. Користувач не повинен вручну копіювати текст по чотири сторінки.
Необхідно перевіряти, що не пропущено жодного речення, абзацу або смислового фрагмента, відсутні дублікати між блоками, а структура відповідає шаблону. Перевірка не повинна базуватися тільки на твердженні нейромережі.
Обробка аудіо
Система також повинна обробляти великі архіви аудіо, наприклад Telegram-канал з 300 ефірами приблизно по одному годині.
Бажано автоматично завантажити аудіо або прийняти весь архів, розпізнати мову і обробити все без ручного участі. По кожному ефіру повинна створюватися структурована витяжка: тема, головні думки, важливі факти, приклади, рекомендації та висновки. Привітання, реклама, розмовний сміття і безглузді повтори видаляються, але корисна інформація зберігається.
Після обробки потрібні не тільки окремі конспекти, але й один загальний читабельний документ, де інформація об'єднана за темами. Якщо тема обговорювалася в різних ефірах, матеріали збираються в один розділ, дублікати видаляються, а посилання на вихідні записи зберігаються.
В результаті повинні бути:
— витяжка по кожному ефіру;
— загальний тематичний документ;
— пошук за словами і темами;
— зв'язок висновків з вихідним аудіо;
— збереження прогресу і продовження після помилок.
Велику частину цих дій я вже можу виконувати самостійно, але тільки на невеликому обсязі і вручну. Тому також готовий розглянути більш ефективний спосіб завантаження і перетворення аудіо в текст, якщо виконавець запропонує рішення краще використовуваного мною.
Що вказати в відповіді
Напишіть:
— як буде реалізована система і який продукт я отримаю;
— які моделі ШІ і розпізнавання мови будуть використовуватися;
— як перевіряється повнота і виключаються пропуски і повтори;
— чи можна змінювати промпти, кількість перекладів, повторень і їх черговість;
— чи можливо завантаження матеріалів з Telegram;
— вартість розробки, API, терміни і ціну подальших доопрацювань.
Головна мета — універсальна система, яка без ручного участі обробляє великі книги і сотні годин аудіо, не втрачає інформацію і видає готовий результат строго за вибраним шаблоном.