Коротко
Почему формат файла меняет ответ нейросети?
На корпоративном обучении в конце сентября участник задал вопрос, который я с тех пор считаю одним из самых практичных:
Документы должны быть машиночитаемые или можно просто образ, картинку бросить?
Короткий ответ: можно и картинку, но результат будет хуже и дороже. Разберём простым языком почему.
Документ, который сохранён из Word или выгружен из учётной системы, содержит текстовый слой: буквы лежат в файле как буквы. Документ, который отсканирован или сфотографирован, - это просто изображение страницы. Человек разницы не видит: на экране обе страницы выглядят одинаково. Нейросеть видит разницу сразу.
Проверить, какой у тебя документ, можно за секунду: открой файл и попробуй выделить слово мышью. Выделяется - текстовый слой есть. Выделяется вся страница целиком как картинка - перед тобой скан.
Что нейросеть делает с PDF, сканом и Word
Как именно устроено чтение, лучше всего видно по документации самих разработчиков моделей.
У Claude при загрузке PDF система извлекает текст каждой страницы и одновременно превращает страницу в изображение. Модель анализирует и то и другое, поэтому понимает графики, схемы и таблицы. Ограничения: обычный PDF без пароля и шифрования, до 32 МБ и до 600 страниц на запрос, а при контекстном окне меньше миллиона токенов - до 100 страниц.
У Gemini PDF тоже читается зрением целиком, вплоть до документов в 1000 страниц. А вот про другие форматы документация говорит прямо: TXT, Markdown, HTML и подобные файлы модель получает как чистый текст, и всё, что было видно при отображении файла - графики, разметка, форматирование, - теряется.
| Формат | Что получает модель | Где риск |
|---|---|---|
| PDF с текстовым слоем | текст и изображение каждой страницы | почти нет, кроме пароля и размера |
| Скан или фото в PDF | только изображение | ошибки распознавания в цифрах, таблицах, мелком шрифте |
| Фото страницы | изображение | наклон, блик, обрезанные края |
| Word, TXT, HTML | чаще всего голый текст | теряются таблицы, сноски, выделения |
| Excel, CSV | таблица | объединённые ячейки и лишние строки над шапкой |
Отсюда простое правило. Если в документе важна вёрстка - таблицы, схемы, подписи к графикам - сохрани его в PDF из исходника, а не отправляй Word. Если важен только текст, подойдёт любой формат с текстовым слоем.
Можно ли просто сфотографировать документ?
Распознавание текста по картинке у современных моделей хорошее. Проблема не в том, что модель не прочитает, а в том, что она прочитает уверенно, но не всегда правильно. Цифра 8 становится 3, запятая в сумме уезжает, строка таблицы склеивается с соседней. И в ответе это выглядит так же убедительно, как правильные данные.
Как сфотографировать, чтобы ошибок было меньше:
- Ровно сверху, без наклона: перекошенная строка распознаётся хуже.
- При дневном свете или ровной лампе, без бликов на глянцевой бумаге.
- Одна страница - один снимок. Разворот книги на одном фото режет середину.
- Края видны целиком: обрезанный край таблицы - это потерянный столбец.
Если документ длинный или в нём таблицы, лучше сначала превратить скан в документ с текстовым слоем. Это называется оптическим распознаванием текста, и оно есть во многих программах для работы с PDF. После этого нейросеть получает буквы, а не картинку.
Как ловить ошибки нейросети до того, как они попадут в отчёт, разбирал в материале про галлюцинации нейросетей.
Сколько стоит скан в лимитах?
Об этом почти никто не думает, пока не упрётся в лимит.
Логика простая. Чем больше в файле картинок, тем больше модели нужно «посмотреть». Сто страниц скана договоров - это сто изображений. Если тебе нужен только раздел про сроки, отдай модели только его.
Три приёма, которые экономят лимит:
- Резать большие документы. Нужна одна глава - загрузи одну главу.
- Отдавать текст, где можно. Выгрузка из учётной системы в PDF с текстом дешевле скана распечатки той же выгрузки.
- Не грузить одно и то же в каждый чат. Документы, к которым ты возвращаешься постоянно, лучше положить в проект или в инструмент, который отвечает по твоим документам. Как это устроено, разбирал в статье про NotebookLM для бизнеса.
Почему переполненный контекст ещё и ухудшает ответы, а не только тратит лимит, разбирал в материале про гигиену контекстного окна.
Таблицы: файл, ссылка или текстом в чат
С таблицами ошибаются чаще всего, потому что они выглядят понятно человеку и непонятно машине. Красивая шапка из трёх строк, объединённые ячейки, итоги посередине, пустые строки-разделители - для модели это шум.
Перед загрузкой таблицы:
- Одна строка заголовков вверху, каждое поле в своём столбце.
- Без объединённых ячеек и без итоговых строк внутри данных.
- Единицы в названии столбца: «Выручка, тыс. руб.», а не цифры с подписью в каждой ячейке.
- Только нужные листы. Таблица на двадцать листов с черновиками сбивает модель.
На том же обучении спрашивали, можно ли дать нейросети ссылку на Google-таблицу, которая постоянно обновляется. Ответ зависит от сервиса: одни умеют подключать таблицы через официальные интеграции, другие откроют ссылку как обычную страницу или не откроют вовсе. Проверь на своём тарифе, а для разовой задачи надёжнее выгрузить свежую копию. Что агенты реально умеют делать прямо внутри Excel, разбирал в материале про агента в Excel и PowerPoint.
Подготовка документов за пять минут
Проверь текстовый слой
Выдели слово мышью. Не выделяется - сначала распознай текст в программе для PDF.
Сними пароль и защиту
Защищённый паролем PDF нейросеть не откроет. Сохрани незащищённую копию для работы.
Раздели большое
Документ на сотни страниц режь на разделы и отдавай нужный.
Назови файлы по смыслу
«Договор поставки 2026, редакция 3» вместо «scan_0045». Понятное имя помогает и модели понять, что перед ней, и тебе потом проверить, откуда взялся факт.
Убери лишние персональные данные
Паспортные данные, телефоны и адреса людей, которые не нужны для задачи. Что ещё нельзя отдавать нейросети, разбирал в материале про чувствительные данные в компании.
Сложи всё в одну папку
Корпоративные мессенджеры при скачивании иногда сохраняют служебные копии файлов с изменённым именем. Одна папка с исходниками надёжнее вложений из чата.
Работа с файлами до вопроса - часть того, что называют контекст-инжинирингом: модель отвечает настолько хорошо, насколько хорошо собран материал, который ей дали.
Частые вопросы
Частые вопросы
Главный вывод
Самая дорогая ошибка тут не в том, что модель чего-то не прочитала, а в том, что прочитала неправильно и уверенно. Неправильная цифра из скана выглядит так же убедительно, как правильная.
Практический шаг на сегодня: возьми документ, который чаще всего отдаёшь нейросети, и попробуй выделить в нём слово мышью. Если не выделяется, переведи его в текст один раз и пользуйся этой версией дальше.
Какие документы ты чаще всего отдаёшь нейросети: сканы или файлы из системы?
Источники
- PDF support - как Claude читает PDF: текст и изображение каждой страницы, лимиты и стоимость в токенах, Claude Platform Docs
- Document understanding - как Gemini читает PDF и почему другие форматы превращаются в голый текст, Google AI for Developers
- Оптическое распознавание символов - что это и как работает, Википедия
