# Скан, PDF или Word: в каком виде давать документы нейросети

В каком формате давать документы нейросети: PDF с текстом, скан, фото, Word или таблица. Как модель их читает, сколько стоит скан в лимитах и как готовить файл.

URL: https://posts.danashkin.ru/guides/dokumenty-dlya-neyroseti-skan-pdf-word
Обновлено: 2026-10-10

---

## Коротко

**Главное**

- Нейросеть читает документ по-разному в зависимости от того, есть ли в нём текстовый слой. PDF с текстом она получает как текст плюс картинку страницы, скан - только как картинку и распознаёт буквы сама, с ошибками в мелком шрифте и таблицах.
- Word, TXT и HTML многие модели читают как голый текст: таблицы и форматирование при этом могут потеряться. Для документов, где важна вёрстка, удобнее PDF с текстовым слоем.
- Скан стоит дороже в лимитах. В документации Claude три страницы PDF в режиме только текста занимают около 1000 токенов, а с картинками страниц - около 7000.
- Перед загрузкой проверь три вещи: выделяется ли текст мышью, нет ли пароля на файле и не слишком ли он большой. Это пять минут, которые экономят час переспрашиваний.

## Почему формат файла меняет ответ нейросети?

**Главное**

Потому что в файле может лежать текст, а может лежать картинка текста. В первом случае нейросеть получает буквы как есть. Во втором ей сначала нужно распознать буквы на изображении, и каждая ошибка распознавания потом едет в ответ: в цифры, фамилии, суммы.

На корпоративном обучении в конце сентября участник задал вопрос, который я с тех пор считаю одним из самых практичных:

> Документы должны быть машиночитаемые или можно просто образ, картинку бросить?
>
> Участник корпоративного обучения, разбор занятия, сентябрь 2026

Короткий ответ: можно и картинку, но результат будет хуже и дороже. Разберём простым языком почему.

Документ, который сохранён из Word или выгружен из учётной системы, содержит текстовый слой: буквы лежат в файле как буквы. Документ, который отсканирован или сфотографирован, - это просто изображение страницы. Человек разницы не видит: на экране обе страницы выглядят одинаково. Нейросеть видит разницу сразу.

Проверить, какой у тебя документ, можно за секунду: открой файл и попробуй выделить слово мышью. Выделяется - текстовый слой есть. Выделяется вся страница целиком как картинка - перед тобой скан.

## Что нейросеть делает с PDF, сканом и Word

**Главное**

PDF с текстовым слоем - лучший вариант: модель получает и текст, и изображение страницы, видит таблицы и графики. Скан - только изображение, модель распознаёт буквы сама. Word, TXT и HTML часто превращаются в голый текст, и всё, что держалось на вёрстке, теряется.

Как именно устроено чтение, лучше всего видно по документации самих разработчиков моделей.

У Claude при загрузке PDF система извлекает текст каждой страницы и одновременно превращает страницу в изображение. Модель анализирует и то и другое, поэтому понимает графики, схемы и таблицы. Ограничения: обычный PDF без пароля и шифрования, до 32 МБ и до 600 страниц на запрос, а при контекстном окне меньше миллиона токенов - до 100 страниц.

У Gemini PDF тоже читается зрением целиком, вплоть до документов в 1000 страниц. А вот про другие форматы документация говорит прямо: TXT, Markdown, HTML и подобные файлы модель получает как чистый текст, и всё, что было видно при отображении файла - графики, разметка, форматирование, - теряется.

| Формат | Что получает модель | Где риск |
|---|---|---|
| PDF с текстовым слоем | текст и изображение каждой страницы | почти нет, кроме пароля и размера |
| Скан или фото в PDF | только изображение | ошибки распознавания в цифрах, таблицах, мелком шрифте |
| Фото страницы | изображение | наклон, блик, обрезанные края |
| Word, TXT, HTML | чаще всего голый текст | теряются таблицы, сноски, выделения |
| Excel, CSV | таблица | объединённые ячейки и лишние строки над шапкой |

Отсюда простое правило. Если в документе важна вёрстка - таблицы, схемы, подписи к графикам - сохрани его в PDF из исходника, а не отправляй Word. Если важен только текст, подойдёт любой формат с текстовым слоем.

## Можно ли просто сфотографировать документ?

**Главное**

Можно, если документ короткий и в нём нет таблиц с цифрами. Фото должно быть ровным, при хорошем свете, одна страница на снимок, без бликов и обрезанных краёв. Всё, что потом пойдёт в отчёт или договор, - цифры, даты, фамилии, суммы - сверяется с оригиналом глазами.

Распознавание текста по картинке у современных моделей хорошее. Проблема не в том, что модель не прочитает, а в том, что она прочитает уверенно, но не всегда правильно. Цифра 8 становится 3, запятая в сумме уезжает, строка таблицы склеивается с соседней. И в ответе это выглядит так же убедительно, как правильные данные.

Как сфотографировать, чтобы ошибок было меньше:

- **Ровно сверху**, без наклона: перекошенная строка распознаётся хуже.
- **При дневном свете или ровной лампе**, без бликов на глянцевой бумаге.
- **Одна страница - один снимок.** Разворот книги на одном фото режет середину.
- **Края видны целиком**: обрезанный край таблицы - это потерянный столбец.

Если документ длинный или в нём таблицы, лучше сначала превратить скан в документ с текстовым слоем. Это называется оптическим распознаванием текста, и оно есть во многих программах для работы с PDF. После этого нейросеть получает буквы, а не картинку.

Как ловить ошибки нейросети до того, как они попадут в отчёт, разбирал в материале про [галлюцинации нейросетей](/guides/gallyucinacii-neyrosetey-kak-proveryat).

## Сколько стоит скан в лимитах?

**Главное**

Картинка страницы стоит заметно дороже текста. В документации Claude пример: три страницы PDF в режиме только текста - около 1000 токенов, в режиме с изображениями страниц - около 7000. Текст обычно занимает 1500-3000 токенов на страницу. Скан, где есть только картинки, быстрее съедает и контекст, и лимит подписки.

Об этом почти никто не думает, пока не упрётся в лимит.

Логика простая. Чем больше в файле картинок, тем больше модели нужно «посмотреть». Сто страниц скана договоров - это сто изображений. Если тебе нужен только раздел про сроки, отдай модели только его.

Три приёма, которые экономят лимит:

1. **Резать большие документы.** Нужна одна глава - загрузи одну главу.
2. **Отдавать текст, где можно.** Выгрузка из учётной системы в PDF с текстом дешевле скана распечатки той же выгрузки.
3. **Не грузить одно и то же в каждый чат.** Документы, к которым ты возвращаешься постоянно, лучше положить в проект или в инструмент, который отвечает по твоим документам. Как это устроено, разбирал в статье про [NotebookLM для бизнеса](/guides/notebooklm-dlya-biznesa).

Почему переполненный контекст ещё и ухудшает ответы, а не только тратит лимит, разбирал в материале про [гигиену контекстного окна](/guides/gigiena-kontekstnogo-okna).

## Таблицы: файл, ссылка или текстом в чат

**Главное**

Таблицу лучше отдавать файлом Excel или CSV с одной строкой заголовков и без объединённых ячеек. Скриншот таблицы - худший вариант: модель распознаёт цифры с картинки. Живую ссылку на таблицу умеют открывать не все сервисы, поэтому надёжнее выгрузить свежую копию или подключить таблицу через официальную интеграцию.

С таблицами ошибаются чаще всего, потому что они выглядят понятно человеку и непонятно машине. Красивая шапка из трёх строк, объединённые ячейки, итоги посередине, пустые строки-разделители - для модели это шум.

Перед загрузкой таблицы:

- **Одна строка заголовков** вверху, каждое поле в своём столбце.
- **Без объединённых ячеек** и без итоговых строк внутри данных.
- **Единицы в названии столбца**: «Выручка, тыс. руб.», а не цифры с подписью в каждой ячейке.
- **Только нужные листы.** Таблица на двадцать листов с черновиками сбивает модель.

На том же обучении спрашивали, можно ли дать нейросети ссылку на Google-таблицу, которая постоянно обновляется. Ответ зависит от сервиса: одни умеют подключать таблицы через официальные интеграции, другие откроют ссылку как обычную страницу или не откроют вовсе. Проверь на своём тарифе, а для разовой задачи надёжнее выгрузить свежую копию. Что агенты реально умеют делать прямо внутри Excel, разбирал в материале про [агента в Excel и PowerPoint](/guides/agent-v-excel-i-powerpoint).

## Подготовка документов за пять минут

**Главное**

Проверь текстовый слой, сними пароль, раздели большие файлы, назови их понятно, убери персональные данные и сложи всё в одну папку. Это и есть основа того, что называют контекст-инжинирингом: качество ответа решается до того, как ты задал вопрос.

1. **Проверь текстовый слой**

   Выдели слово мышью. Не выделяется - сначала распознай текст в программе для PDF.

2. **Сними пароль и защиту**

   Защищённый паролем PDF нейросеть не откроет. Сохрани незащищённую копию для работы.

3. **Раздели большое**

   Документ на сотни страниц режь на разделы и отдавай нужный.

4. **Назови файлы по смыслу**

   «Договор поставки 2026, редакция 3» вместо «scan_0045». Понятное имя помогает и модели понять, что перед ней, и тебе потом проверить, откуда взялся факт.

5. **Убери лишние персональные данные**

   Паспортные данные, телефоны и адреса людей, которые не нужны для задачи. Что ещё нельзя отдавать нейросети, разбирал в материале про [чувствительные данные в компании](/guides/chuvstvitelnye-dannye-i-neyroseti-v-kompanii).

6. **Сложи всё в одну папку**

   Корпоративные мессенджеры при скачивании иногда сохраняют служебные копии файлов с изменённым именем. Одна папка с исходниками надёжнее вложений из чата.

Работа с файлами до вопроса - часть того, что называют [контекст-инжинирингом](/concepts/context-engineering): модель отвечает настолько хорошо, насколько хорошо собран материал, который ей дали.

## Частые вопросы

**Главное**

Спрашивают про рукописные документы, печати и подписи, про объём и про то, что делать, если модель «не видит» файл.

### Частые вопросы

**Нейросеть читает рукописный текст?**

Часто читает, но с ошибками, особенно в цифрах и фамилиях. Для рукописи всегда проси сначала дословную расшифровку и сверяй её с оригиналом, а уже потом задачу по содержанию.

**Модель видит печати и подписи на скане?**

Видит как изображение и может сказать, что печать есть. Но проверять подлинность документа по скану нейросетью нельзя: это задача человека и официальных сервисов.

**Модель пишет, что не может открыть файл. Что делать?**

Проверь пароль, размер и формат. Частая причина - защищённый PDF или файл больше лимита сервиса. Пересохрани без защиты или раздели на части.

**Что лучше дать: Word или PDF?**

Если важна вёрстка, таблицы и схемы - PDF, сохранённый из исходника. Если нужен только текст, разницы почти нет, главное, чтобы в файле был текстовый слой.

## Главный вывод

**Главное**

Нейросеть работает лучше всего с документами, в которых есть текстовый слой: PDF из исходника, выгрузка из системы, аккуратная таблица. Скан и фото она тоже прочитает, но дороже по лимитам и с ошибками в цифрах. Пять минут подготовки файлов экономят час переспрашиваний и проверок.

Самая дорогая ошибка тут не в том, что модель чего-то не прочитала, а в том, что прочитала неправильно и уверенно. Неправильная цифра из скана выглядит так же убедительно, как правильная.

Практический шаг на сегодня: возьми документ, который чаще всего отдаёшь нейросети, и попробуй выделить в нём слово мышью. Если не выделяется, переведи его в текст один раз и пользуйся этой версией дальше.

Какие документы ты чаще всего отдаёшь нейросети: сканы или файлы из системы?

### Источники

- [PDF support - как Claude читает PDF: текст и изображение каждой страницы, лимиты и стоимость в токенах, Claude Platform Docs](https://platform.claude.com/docs/en/build-with-claude/pdf-support)
- [Document understanding - как Gemini читает PDF и почему другие форматы превращаются в голый текст, Google AI for Developers](https://ai.google.dev/gemini-api/docs/document-processing)
- [Оптическое распознавание символов - что это и как работает, Википедия](https://ru.wikipedia.org/wiki/%D0%9E%D0%BF%D1%82%D0%B8%D1%87%D0%B5%D1%81%D0%BA%D0%BE%D0%B5_%D1%80%D0%B0%D1%81%D0%BF%D0%BE%D0%B7%D0%BD%D0%B0%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D1%81%D0%B8%D0%BC%D0%B2%D0%BE%D0%BB%D0%BE%D0%B2)
