Как нейросеть распознаёт текст на изображении?
Классические программы распознавания сверяют очертания букв с образцами. Нейросеть работает иначе: она видит картинку целиком и понимает содержание — где заголовок, где подпись к фотографии, где строка таблицы, а где номер страницы. Поэтому сервис справляется там, где обычный OCR-конвертер ломается: на фото под углом, с неровным светом, с рукописной пометкой на полях.
Понимание смысла помогает и с ошибками. Если буква смазана, модель восстанавливает слово по контексту, а не выдаёт случайный символ. Из-за этого точность на фотографиях чека, вывески или страницы книги выходит выше, чем если отсканировать лист и прогнать его через классическую программу.
Что можно загрузить
| Тип изображения | Что получится на выходе |
|---|---|
| Фото страницы книги или документа | текст с абзацами и заголовками |
| Скан договора или справки | структура с пунктами и подпунктами |
| Скриншот переписки или интерфейса | реплики и подписи по порядку |
| Фотография таблицы | таблица строками, готовая к переносу |
| Снимок доски или конспекта | текст, включая разборчивый рукописный |
| Чек или счёт | позиции, суммы и итог |
Формат файла значения не имеет: подойдёт фотография с телефона, скриншот или скан — преобразовать в текст получится любой из них. Важнее, чтобы текст на снимке был читаемым для человеческого глаза — то, что не разобрать вам, не разберёт и модель.
Сохранится ли форматирование документа?
Структура сохраняется, оформление — нет. Вы получите текст с сохранённым порядком блоков: заголовки останутся заголовками, списки — списками, таблица придёт таблицей. Шрифты, колонки, отступы и цвета не переносятся, потому что результат — это текст, а не копия вёрстки.
Дальше текст можно редактировать где угодно: скопируйте его в Word или Google Docs одним движением — вставка сохранит абзацы и списки, конвертировать ничего не нужно. Если нужен другой вид — «оформи списком», «перепиши в две колонки», «убери переносы строк» — попросите об этом в том же чате.
Языки и перевод
Русский, английский и другие распространённые языки, в том числе вперемешку в одном документе. Отдельно указывать язык не нужно — модель определяет его сама.
Тут же можно и перевести: напишите «переведи на английский», и текст придёт уже на нужном языке. Для длинных документов лучше делать это вторым запросом, чтобы сначала проверить распознанное.
Что ещё можно сделать с распознанным текстом?
Результат приходит в чат, а не файлом, поэтому с ним сразу можно работать дальше: попросить краткий пересказ длинного документа, извлечь из договора даты и суммы, собрать список задач из фотографии доски. Каждый такой запрос — отдельная генерация.
Соседние карточки продолжают ту же цепочку: чат с нейросетью разберёт распознанный документ по вопросам, а сократить текст пригодится, когда из десяти страниц нужна одна.
Сколько стоит распознавание?
Одна обработка — 25 токенов независимо от объёма текста на изображении. Новым пользователям начисляется приветственный бонус токенов — первое извлечение текста выходит бесплатным, отдельный бесплатный лимит для этого не нужен.
Многостраничный документ загружайте по одной странице: так меньше риск, что часть текста потеряется, и проще проверить результат.
Когда текст распознаётся плохо?
- Снимок размыт или сделан в темноте. Модель достроит слова по смыслу — и может ошибиться в цифрах.
- Мелкий шрифт на общем плане. Сфотографируйте страницу ближе, иначе сноски и примечания выпадут.
- Сложная рукопись. Аккуратный почерк читается, размашистый — через раз.
- Текст поверх изображения. Надписи на фотографии распознаются, но порядок блоков может сбиться.
Важно: цифры всегда проверяйте глазами. В чеке, счёте или таблице ошибка в одном разряде меняет смысл, а модель восстанавливает нечитаемое по контексту.