Гайды

Нейросеть для анализа документов: что умеет?

Изображение демонстрирует различные форматы файлов, такие как PDF, DOCX, XLSX и скан страницы, которые нейросеть принимает для анализа документов.

Коротко

Нейросеть для анализа документов умеет отвечать на вопросы, сжимать отчёты, извлекать данные и сверять редакции. Она работает с PDF, DOCX, XLSX и сканами, но скан или фотография страницы работают через распознавание. Важно учитывать ограничения провайдеров по объёму файлов и страниц, а также перепроверять арифметику, отрицания и цитаты, так как в этих областях возможны ошибки.

Содержание
  1. Что умеет нейросеть для анализа документов?
  2. Какие форматы файлов читают ИИ-сервисы?
  3. Сколько страниц документа реально влезает в один запрос?
  4. Правда ли, что модель теряет середину длинного документа?
  5. Где нейросеть ошибается при анализе документов
  6. Безопасно ли загружать личные договоры и финансовые отчёты?
  7. Как разобрать договор за три захода
  8. Какую модель выбрать под документ
  9. Источники

Что умеет нейросеть для анализа документов?

Нейросеть для анализа документов отвечает на вопросы по содержимому файла: находит нужный пункт, сжимает отчёт до тезисов, вытаскивает даты и суммы в список, сверяет две редакции договора. Современные модели видят страницу и как текст, и как картинку, поэтому скан с печатью тоже идёт в работу.

Задачи делятся на две группы, и это деление важнее любого рейтинга сервисов. Первая группа — найти и пересказать. Вторая — пересчитать: сложить суммы, посчитать пункты, свести проценты. С первой модели справляются уверенно. Со второй как повезёт, и граница проходит по арифметике.

В документации Gemini API за 2026 год есть важная оговорка: понимание страницы «зрением» работает только для PDF. Файлы TXT, Markdown, HTML и XML модель получает как голый текст, и всё, что в них было графикой — схемы, диаграммы, разметка, — теряется по дороге. Отсюда практическое следствие: спорный документ лучше нести именно в PDF.

Какие форматы файлов читают ИИ-сервисы?

PDF — основной формат, остальное модель разбирает как обычный текст. DOCX, TXT, CSV и XLSX сервисы обычно принимают, но перед отправкой конвертируют, и вёрстка при этом упрощается. Скан или фотография страницы работают через распознавание: как это устроено, разбирали в материале про распознавание текста с картинки.

Форматы файлов, которые нейросеть принимает для анализа документов: PDF, DOCX, XLSX и скан страницы

Лимиты у провайдеров разные, и об это спотыкается каждый, у кого на руках толстое дело. Google в документации Gemini API указывает потолок: PDF до 50 МБ или 1000 страниц, каждая страница засчитывается как 258 токенов. Крупные развороты ужимаются до 3072 × 3072 пикселей, мелкие растягиваются до 768 × 768.

У Anthropic рамка другая. В документации Claude заявлены 32 МБ на весь запрос и до 600 страниц, причём шестьсот доступны только моделям с контекстным окном от миллиона токенов; у остальных потолок падает до 100 страниц. PDF с паролем не примут вовсе.

ОграничениеGemini APIClaude API
Максимум страниц за запрос1000600, но 100 при контексте меньше 1 млн токенов
Максимальный размер50 МБ на файл32 МБ на весь запрос
Защита паролемфайл не принимается
Вес одной страницы258 токеновсчитается по содержимому

Сколько страниц документа реально влезает в один запрос?

Влезает столько, сколько помещается в контекстное окно модели, а страницы PDF расходуют его быстрее, чем ожидаешь. Умножьте 258 токенов на число страниц — и получите нижнюю границу, к которой ещё добавится ваш вопрос и ответ модели.

Google описывает миллион токенов наглядно: это примерно 50 000 строк кода, восемь романов средней длины или расшифровки более чем двухсот подкастов (документация Gemini API, раздел про длинный контекст). Там же напоминают, что ранние модели работали с 8000 токенов за раз. Разница в два порядка и объясняет, почему разбор договора целиком стал бытовой задачей.

Дальше начинается тонкость: заявленный объём окна и полезный объём — не одно и то же. Чем плотнее набит контекст, тем аккуратнее приходится формулировать вопрос. Механику окна и способы его экономить разобрали отдельно в статье про контекстное окно нейросети.

Правда ли, что модель теряет середину длинного документа?

Наполовину правда. Эффект описан в исследовании, но на поиске по характерному слову он у нас не проявился.

В 2023 году исследователи Стэнфордского университета опубликовали работу «Lost in the Middle: How Language Models Use Long Contexts» (Nelson F. Liu с соавторами, arXiv). Вывод: точность зависит от того, где в длинном контексте лежит нужный фрагмент. Лучше всего читаются начало и конец, в середине результат заметно проседает, и это верно даже для моделей, заявленных как длинноконтекстные.

Начало и конец длинного документа модель читает уверенно, середина проседает

Мы собрали синтетический договор на 900 пунктов: 14 073 слова, 27 902 токена на входе. В пять позиций — на 5, 27, 50, 73 и 95 процентах длины — вшили пункты про штрафы с разными ставками и попросили Gemini 2.5 Flash перечислить их все. Модель нашла пять из пяти, включая тот, что лежал ровно посередине. На укороченной версии в 200 пунктов результат повторился.

Значит, когда искомое отличается словом («неустойка», «штраф»), середина не пропадает. Провал из статьи бьёт по другому сценарию: когда нужный кусок лексически не выделяется и модели приходится удерживать десятки похожих фрагментов сразу. Для договора это вопрос вроде «где здесь скрытые обязательства» — там перепроверять придётся.

Где нейросеть ошибается при анализе документов

Первым ломается пересчёт. Тот же договор, тот же файл, вопрос простой: сколько в нём всего пронумерованных пунктов. Модель ответила «901» при девятистах. Ошибка на единицу — ровно та, которую никто не пойдёт проверять: число выглядит правдоподобно.

Проверка на выдумку, наоборот, прошла чисто. Мы спросили про неустойку за нарушение сроков оплаты, хотя такого пункта в договоре не было. Ответ: такого условия нет, а есть пять других санкций, вот их номера. Придумывать модель не стала. В задаче «найди в приложенном тексте» галлюцинации случаются реже, чем в задаче «расскажи, что знаешь».

Что перепроверять руками всегда:

  • Арифметику. Итоги, проценты, количества, сроки в днях.
  • Отрицания. «Не допускается», «за исключением», «кроме случаев» — модель иногда сворачивает оговорку и меняет смысл на противоположный.
  • Цитаты. Просите номер пункта рядом с каждым утверждением, тогда проверка занимает секунды.

Безопасно ли загружать личные договоры и финансовые отчёты?

Паспортные данные, банковские реквизиты и коммерческую тайну в чужой сервис отправлять не стоит. Причина простая: файл уходит на сторонний сервер, живёт там в логах и попадает под чужую политику хранения.

Рабочий компромисс — обезличивание. Замените ФИО на «Сторона 1» и «Сторона 2», номера счетов на XXXX, адреса на «город N». Смысл документа от этого не меняется, а модель отвечает ровно так же: юридическая конструкция читается без персональных данных. Если документ содержит гостайну или медицинские записи, вариант один — не выгружать вовсе.

Отдельно про юридические документы. Разбор нейросетью — это черновик мнения, а не заключение. Модель подсветит слабые места и странные формулировки, но подпись под договором ставите вы, и ответственность остаётся на вас.

Как разобрать договор за три захода

Один длинный вопрос работает хуже трёх коротких. Проверенная последовательность выглядит так.

  1. Карта документа. «Перечисли разделы и одной строкой опиши, о чём каждый». Так вы увидите структуру и поймёте, где искать дальше.
  2. Целевой вопрос. «Выпиши все обязательства Заказчика с номерами пунктов и сроками». Требование указать номер пункта дисциплинирует модель и упрощает сверку.
  3. Красные флаги. «Найди условия, которые невыгодны Исполнителю, и объясни почему». Здесь ответ уже оценочный, поэтому читать его нужно скептически.

Приём, который экономит время: попросите ответ таблицей «пункт — обязательство — срок — риск». Структурированный вывод легче проверять глазами, чем сплошной пересказ. Дальше эту таблицу можно докрутить в разборе данных — как это делается, описано в гайде про нейросети для таблиц.

Какую модель выбрать под документ

Для длинных файлов берите модель с большим контекстом и внятной работой с PDF. По документации это линейки Gemini и Claude: у первой выше потолок по страницам, у второй строже требования к размеру запроса. Для коротких документов на пару страниц разницы почти нет, так что переплачивать незачем.

В каталоге Trackly обе линейки живут в одном окне, оплата в рублях и без VPN. Сообщение Gemini 2.5 Pro стоит 30 токенов, сообщение Claude Sonnet 4.6 — 40 токенов; на первые запросы хватает приветственного бонуса после регистрации.

Есть и ограничение: загрузки PDF-файла целиком в чате Trackly пока нет. Длинный документ вставляется текстом, а к сообщению прикрепляется фото — например, снимок спорной страницы с печатью и подписями. Для договора на десять страниц этого хватает; для дела на триста придётся работать по частям, разбивая документ на разделы.

Источники

Поделиться: TelegramVKWhatsApp

Частые вопросы

Что умеет нейросеть для анализа документов?+

Нейросеть для анализа документов отвечает на вопросы по содержимому файла, находит нужный пункт, сжимает отчёты до тезисов, вытаскивает даты и суммы в список, а также сверяет две редакции договора. Современные модели видят страницу и как текст, и как картинку, поэтому скан с печатью тоже идёт в работу.

Какие форматы файлов читают ИИ-сервисы?+

Основной формат — PDF. DOCX, TXT, CSV и XLSX сервисы обычно принимают, но перед отправкой конвертируют, и вёрстка при этом упрощается. Скан или фотография страницы работают через распознавание текста.

Сколько страниц документа реально влезает в один запрос?+

В один запрос влезает столько, сколько помещается в контекстное окно модели. Например, Google Gemini API указывает потолок в 1000 страниц PDF или 50 МБ, где каждая страница засчитывается как 258 токенов. У Anthropic Claude заявлены 32 МБ на весь запрос и до 600 страниц.

Где нейросеть ошибается при анализе документов?+

Нейросеть чаще всего ошибается при пересчёте — арифметике, подсчёте итогов, процентов, количеств и сроков. Также следует перепроверять отрицания, такие как «не допускается» или «за исключением», поскольку модель иногда меняет смысл. Цитаты рекомендуется проверять, запрашивая номер пункта рядом с каждым утверждением.

Попробуйте прямо сейчас

Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.

Попробовать модели в Trackly