Нейросеть для анализа документов: что умеет?

Коротко
Нейросеть для анализа документов умеет отвечать на вопросы, сжимать отчёты, извлекать данные и сверять редакции. Она работает с PDF, DOCX, XLSX и сканами, но скан или фотография страницы работают через распознавание. Важно учитывать ограничения провайдеров по объёму файлов и страниц, а также перепроверять арифметику, отрицания и цитаты, так как в этих областях возможны ошибки.
Содержание
- Что умеет нейросеть для анализа документов?
- Какие форматы файлов читают ИИ-сервисы?
- Сколько страниц документа реально влезает в один запрос?
- Правда ли, что модель теряет середину длинного документа?
- Где нейросеть ошибается при анализе документов
- Безопасно ли загружать личные договоры и финансовые отчёты?
- Как разобрать договор за три захода
- Какую модель выбрать под документ
- Источники
Что умеет нейросеть для анализа документов?
Нейросеть для анализа документов отвечает на вопросы по содержимому файла: находит нужный пункт, сжимает отчёт до тезисов, вытаскивает даты и суммы в список, сверяет две редакции договора. Современные модели видят страницу и как текст, и как картинку, поэтому скан с печатью тоже идёт в работу.
Задачи делятся на две группы, и это деление важнее любого рейтинга сервисов. Первая группа — найти и пересказать. Вторая — пересчитать: сложить суммы, посчитать пункты, свести проценты. С первой модели справляются уверенно. Со второй как повезёт, и граница проходит по арифметике.
В документации Gemini API за 2026 год есть важная оговорка: понимание страницы «зрением» работает только для PDF. Файлы TXT, Markdown, HTML и XML модель получает как голый текст, и всё, что в них было графикой — схемы, диаграммы, разметка, — теряется по дороге. Отсюда практическое следствие: спорный документ лучше нести именно в PDF.
Какие форматы файлов читают ИИ-сервисы?
PDF — основной формат, остальное модель разбирает как обычный текст. DOCX, TXT, CSV и XLSX сервисы обычно принимают, но перед отправкой конвертируют, и вёрстка при этом упрощается. Скан или фотография страницы работают через распознавание: как это устроено, разбирали в материале про распознавание текста с картинки.

Лимиты у провайдеров разные, и об это спотыкается каждый, у кого на руках толстое дело. Google в документации Gemini API указывает потолок: PDF до 50 МБ или 1000 страниц, каждая страница засчитывается как 258 токенов. Крупные развороты ужимаются до 3072 × 3072 пикселей, мелкие растягиваются до 768 × 768.
У Anthropic рамка другая. В документации Claude заявлены 32 МБ на весь запрос и до 600 страниц, причём шестьсот доступны только моделям с контекстным окном от миллиона токенов; у остальных потолок падает до 100 страниц. PDF с паролем не примут вовсе.
| Ограничение | Gemini API | Claude API |
|---|---|---|
| Максимум страниц за запрос | 1000 | 600, но 100 при контексте меньше 1 млн токенов |
| Максимальный размер | 50 МБ на файл | 32 МБ на весь запрос |
| Защита паролем | — | файл не принимается |
| Вес одной страницы | 258 токенов | считается по содержимому |
Сколько страниц документа реально влезает в один запрос?
Влезает столько, сколько помещается в контекстное окно модели, а страницы PDF расходуют его быстрее, чем ожидаешь. Умножьте 258 токенов на число страниц — и получите нижнюю границу, к которой ещё добавится ваш вопрос и ответ модели.
Google описывает миллион токенов наглядно: это примерно 50 000 строк кода, восемь романов средней длины или расшифровки более чем двухсот подкастов (документация Gemini API, раздел про длинный контекст). Там же напоминают, что ранние модели работали с 8000 токенов за раз. Разница в два порядка и объясняет, почему разбор договора целиком стал бытовой задачей.
Дальше начинается тонкость: заявленный объём окна и полезный объём — не одно и то же. Чем плотнее набит контекст, тем аккуратнее приходится формулировать вопрос. Механику окна и способы его экономить разобрали отдельно в статье про контекстное окно нейросети.
Правда ли, что модель теряет середину длинного документа?
Наполовину правда. Эффект описан в исследовании, но на поиске по характерному слову он у нас не проявился.
В 2023 году исследователи Стэнфордского университета опубликовали работу «Lost in the Middle: How Language Models Use Long Contexts» (Nelson F. Liu с соавторами, arXiv). Вывод: точность зависит от того, где в длинном контексте лежит нужный фрагмент. Лучше всего читаются начало и конец, в середине результат заметно проседает, и это верно даже для моделей, заявленных как длинноконтекстные.

Мы собрали синтетический договор на 900 пунктов: 14 073 слова, 27 902 токена на входе. В пять позиций — на 5, 27, 50, 73 и 95 процентах длины — вшили пункты про штрафы с разными ставками и попросили Gemini 2.5 Flash перечислить их все. Модель нашла пять из пяти, включая тот, что лежал ровно посередине. На укороченной версии в 200 пунктов результат повторился.
Значит, когда искомое отличается словом («неустойка», «штраф»), середина не пропадает. Провал из статьи бьёт по другому сценарию: когда нужный кусок лексически не выделяется и модели приходится удерживать десятки похожих фрагментов сразу. Для договора это вопрос вроде «где здесь скрытые обязательства» — там перепроверять придётся.
Где нейросеть ошибается при анализе документов
Первым ломается пересчёт. Тот же договор, тот же файл, вопрос простой: сколько в нём всего пронумерованных пунктов. Модель ответила «901» при девятистах. Ошибка на единицу — ровно та, которую никто не пойдёт проверять: число выглядит правдоподобно.
Проверка на выдумку, наоборот, прошла чисто. Мы спросили про неустойку за нарушение сроков оплаты, хотя такого пункта в договоре не было. Ответ: такого условия нет, а есть пять других санкций, вот их номера. Придумывать модель не стала. В задаче «найди в приложенном тексте» галлюцинации случаются реже, чем в задаче «расскажи, что знаешь».
Что перепроверять руками всегда:
- Арифметику. Итоги, проценты, количества, сроки в днях.
- Отрицания. «Не допускается», «за исключением», «кроме случаев» — модель иногда сворачивает оговорку и меняет смысл на противоположный.
- Цитаты. Просите номер пункта рядом с каждым утверждением, тогда проверка занимает секунды.
Безопасно ли загружать личные договоры и финансовые отчёты?
Паспортные данные, банковские реквизиты и коммерческую тайну в чужой сервис отправлять не стоит. Причина простая: файл уходит на сторонний сервер, живёт там в логах и попадает под чужую политику хранения.
Рабочий компромисс — обезличивание. Замените ФИО на «Сторона 1» и «Сторона 2», номера счетов на XXXX, адреса на «город N». Смысл документа от этого не меняется, а модель отвечает ровно так же: юридическая конструкция читается без персональных данных. Если документ содержит гостайну или медицинские записи, вариант один — не выгружать вовсе.
Отдельно про юридические документы. Разбор нейросетью — это черновик мнения, а не заключение. Модель подсветит слабые места и странные формулировки, но подпись под договором ставите вы, и ответственность остаётся на вас.
Как разобрать договор за три захода
Один длинный вопрос работает хуже трёх коротких. Проверенная последовательность выглядит так.
- Карта документа. «Перечисли разделы и одной строкой опиши, о чём каждый». Так вы увидите структуру и поймёте, где искать дальше.
- Целевой вопрос. «Выпиши все обязательства Заказчика с номерами пунктов и сроками». Требование указать номер пункта дисциплинирует модель и упрощает сверку.
- Красные флаги. «Найди условия, которые невыгодны Исполнителю, и объясни почему». Здесь ответ уже оценочный, поэтому читать его нужно скептически.
Приём, который экономит время: попросите ответ таблицей «пункт — обязательство — срок — риск». Структурированный вывод легче проверять глазами, чем сплошной пересказ. Дальше эту таблицу можно докрутить в разборе данных — как это делается, описано в гайде про нейросети для таблиц.
Какую модель выбрать под документ
Для длинных файлов берите модель с большим контекстом и внятной работой с PDF. По документации это линейки Gemini и Claude: у первой выше потолок по страницам, у второй строже требования к размеру запроса. Для коротких документов на пару страниц разницы почти нет, так что переплачивать незачем.
В каталоге Trackly обе линейки живут в одном окне, оплата в рублях и без VPN. Сообщение Gemini 2.5 Pro стоит 30 токенов, сообщение Claude Sonnet 4.6 — 40 токенов; на первые запросы хватает приветственного бонуса после регистрации.
Есть и ограничение: загрузки PDF-файла целиком в чате Trackly пока нет. Длинный документ вставляется текстом, а к сообщению прикрепляется фото — например, снимок спорной страницы с печатью и подписями. Для договора на десять страниц этого хватает; для дела на триста придётся работать по частям, разбивая документ на разделы.
Источники
- Nelson F. Liu и соавторы. Lost in the Middle: How Language Models Use Long Contexts, arXiv, 2023 (проверено 07.08.2026).
- Google. Document understanding, Gemini API — лимиты PDF и стоимость страницы (проверено 07.08.2026).
- Google. Long context, Gemini API — что помещается в миллион токенов (проверено 07.08.2026).
- Anthropic. PDF support, Claude Docs — ограничения по страницам и размеру запроса (проверено 07.08.2026).
Частые вопросы
Что умеет нейросеть для анализа документов?+
Нейросеть для анализа документов отвечает на вопросы по содержимому файла, находит нужный пункт, сжимает отчёты до тезисов, вытаскивает даты и суммы в список, а также сверяет две редакции договора. Современные модели видят страницу и как текст, и как картинку, поэтому скан с печатью тоже идёт в работу.
Какие форматы файлов читают ИИ-сервисы?+
Основной формат — PDF. DOCX, TXT, CSV и XLSX сервисы обычно принимают, но перед отправкой конвертируют, и вёрстка при этом упрощается. Скан или фотография страницы работают через распознавание текста.
Сколько страниц документа реально влезает в один запрос?+
В один запрос влезает столько, сколько помещается в контекстное окно модели. Например, Google Gemini API указывает потолок в 1000 страниц PDF или 50 МБ, где каждая страница засчитывается как 258 токенов. У Anthropic Claude заявлены 32 МБ на весь запрос и до 600 страниц.
Где нейросеть ошибается при анализе документов?+
Нейросеть чаще всего ошибается при пересчёте — арифметике, подсчёте итогов, процентов, количеств и сроков. Также следует перепроверять отрицания, такие как «не допускается» или «за исключением», поскольку модель иногда меняет смысл. Цитаты рекомендуется проверять, запрашивая номер пункта рядом с каждым утверждением.
Попробуйте прямо сейчас
Без VPN и зарубежных карт — оплата в рублях, первый шаг за минуту.
Попробовать модели в Trackly