Дмитрий Анашкин

Скан, PDF или Word: в каком виде давать документы нейросети

Опубликовано 10 окт. 2026 г.8 мин чтенияНачальный
Стопка бумажных документов, сканер, фотография страницы и таблица превращаются в аккуратный текст на экране ноутбука. Никаких логотипов, значков программ и названий брендов
Туториал
Скан, PDF или Word
Дмитрий Анашкин · 8 мин
Чему вы научитесь
  • Почему формат файла меняет ответ нейросети
  • Что модель делает с PDF, сканом, фото, Word и таблицей
  • Как сфотографировать документ, чтобы ошибок было меньше
  • Сколько стоит скан в лимитах по сравнению с текстом
  • Как подготовить документы к загрузке за пять минут
Начальный

Коротко

Почему формат файла меняет ответ нейросети?

На корпоративном обучении в конце сентября участник задал вопрос, который я с тех пор считаю одним из самых практичных:

Документы должны быть машиночитаемые или можно просто образ, картинку бросить?

- Участник корпоративного обучения, разбор занятия, сентябрь 2026

Короткий ответ: можно и картинку, но результат будет хуже и дороже. Разберём простым языком почему.

Документ, который сохранён из Word или выгружен из учётной системы, содержит текстовый слой: буквы лежат в файле как буквы. Документ, который отсканирован или сфотографирован, - это просто изображение страницы. Человек разницы не видит: на экране обе страницы выглядят одинаково. Нейросеть видит разницу сразу.

Проверить, какой у тебя документ, можно за секунду: открой файл и попробуй выделить слово мышью. Выделяется - текстовый слой есть. Выделяется вся страница целиком как картинка - перед тобой скан.

Что нейросеть делает с PDF, сканом и Word

Как именно устроено чтение, лучше всего видно по документации самих разработчиков моделей.

У Claude при загрузке PDF система извлекает текст каждой страницы и одновременно превращает страницу в изображение. Модель анализирует и то и другое, поэтому понимает графики, схемы и таблицы. Ограничения: обычный PDF без пароля и шифрования, до 32 МБ и до 600 страниц на запрос, а при контекстном окне меньше миллиона токенов - до 100 страниц.

У Gemini PDF тоже читается зрением целиком, вплоть до документов в 1000 страниц. А вот про другие форматы документация говорит прямо: TXT, Markdown, HTML и подобные файлы модель получает как чистый текст, и всё, что было видно при отображении файла - графики, разметка, форматирование, - теряется.

ФорматЧто получает модельГде риск
PDF с текстовым слоемтекст и изображение каждой страницыпочти нет, кроме пароля и размера
Скан или фото в PDFтолько изображениеошибки распознавания в цифрах, таблицах, мелком шрифте
Фото страницыизображениенаклон, блик, обрезанные края
Word, TXT, HTMLчаще всего голый тексттеряются таблицы, сноски, выделения
Excel, CSVтаблицаобъединённые ячейки и лишние строки над шапкой

Отсюда простое правило. Если в документе важна вёрстка - таблицы, схемы, подписи к графикам - сохрани его в PDF из исходника, а не отправляй Word. Если важен только текст, подойдёт любой формат с текстовым слоем.

Можно ли просто сфотографировать документ?

Распознавание текста по картинке у современных моделей хорошее. Проблема не в том, что модель не прочитает, а в том, что она прочитает уверенно, но не всегда правильно. Цифра 8 становится 3, запятая в сумме уезжает, строка таблицы склеивается с соседней. И в ответе это выглядит так же убедительно, как правильные данные.

Как сфотографировать, чтобы ошибок было меньше:

  • Ровно сверху, без наклона: перекошенная строка распознаётся хуже.
  • При дневном свете или ровной лампе, без бликов на глянцевой бумаге.
  • Одна страница - один снимок. Разворот книги на одном фото режет середину.
  • Края видны целиком: обрезанный край таблицы - это потерянный столбец.

Если документ длинный или в нём таблицы, лучше сначала превратить скан в документ с текстовым слоем. Это называется оптическим распознаванием текста, и оно есть во многих программах для работы с PDF. После этого нейросеть получает буквы, а не картинку.

Как ловить ошибки нейросети до того, как они попадут в отчёт, разбирал в материале про галлюцинации нейросетей.

Сколько стоит скан в лимитах?

Об этом почти никто не думает, пока не упрётся в лимит.

Логика простая. Чем больше в файле картинок, тем больше модели нужно «посмотреть». Сто страниц скана договоров - это сто изображений. Если тебе нужен только раздел про сроки, отдай модели только его.

Три приёма, которые экономят лимит:

  1. Резать большие документы. Нужна одна глава - загрузи одну главу.
  2. Отдавать текст, где можно. Выгрузка из учётной системы в PDF с текстом дешевле скана распечатки той же выгрузки.
  3. Не грузить одно и то же в каждый чат. Документы, к которым ты возвращаешься постоянно, лучше положить в проект или в инструмент, который отвечает по твоим документам. Как это устроено, разбирал в статье про NotebookLM для бизнеса.

Почему переполненный контекст ещё и ухудшает ответы, а не только тратит лимит, разбирал в материале про гигиену контекстного окна.

Таблицы: файл, ссылка или текстом в чат

С таблицами ошибаются чаще всего, потому что они выглядят понятно человеку и непонятно машине. Красивая шапка из трёх строк, объединённые ячейки, итоги посередине, пустые строки-разделители - для модели это шум.

Перед загрузкой таблицы:

  • Одна строка заголовков вверху, каждое поле в своём столбце.
  • Без объединённых ячеек и без итоговых строк внутри данных.
  • Единицы в названии столбца: «Выручка, тыс. руб.», а не цифры с подписью в каждой ячейке.
  • Только нужные листы. Таблица на двадцать листов с черновиками сбивает модель.

На том же обучении спрашивали, можно ли дать нейросети ссылку на Google-таблицу, которая постоянно обновляется. Ответ зависит от сервиса: одни умеют подключать таблицы через официальные интеграции, другие откроют ссылку как обычную страницу или не откроют вовсе. Проверь на своём тарифе, а для разовой задачи надёжнее выгрузить свежую копию. Что агенты реально умеют делать прямо внутри Excel, разбирал в материале про агента в Excel и PowerPoint.

Подготовка документов за пять минут

  1. Проверь текстовый слой

    Выдели слово мышью. Не выделяется - сначала распознай текст в программе для PDF.

  2. Сними пароль и защиту

    Защищённый паролем PDF нейросеть не откроет. Сохрани незащищённую копию для работы.

  3. Раздели большое

    Документ на сотни страниц режь на разделы и отдавай нужный.

  4. Назови файлы по смыслу

    «Договор поставки 2026, редакция 3» вместо «scan_0045». Понятное имя помогает и модели понять, что перед ней, и тебе потом проверить, откуда взялся факт.

  5. Убери лишние персональные данные

    Паспортные данные, телефоны и адреса людей, которые не нужны для задачи. Что ещё нельзя отдавать нейросети, разбирал в материале про чувствительные данные в компании.

  6. Сложи всё в одну папку

    Корпоративные мессенджеры при скачивании иногда сохраняют служебные копии файлов с изменённым именем. Одна папка с исходниками надёжнее вложений из чата.

Работа с файлами до вопроса - часть того, что называют контекст-инжинирингом: модель отвечает настолько хорошо, насколько хорошо собран материал, который ей дали.

Частые вопросы

Частые вопросы

Главный вывод

Самая дорогая ошибка тут не в том, что модель чего-то не прочитала, а в том, что прочитала неправильно и уверенно. Неправильная цифра из скана выглядит так же убедительно, как правильная.

Практический шаг на сегодня: возьми документ, который чаще всего отдаёшь нейросети, и попробуй выделить в нём слово мышью. Если не выделяется, переведи его в текст один раз и пользуйся этой версией дальше.

Какие документы ты чаще всего отдаёшь нейросети: сканы или файлы из системы?

Источники

Отправь другу или себе в избранное в Telegram, чтобы не потерять.

Поделиться в Telegram
Было полезно?
Автор
Дмитрий Анашкин
Практик-интегратор ИИ в бизнес

Основатель NeuroDA и SMAIPL. Корпоративные воркшопы по ИИ, внедрение AI в бизнес-процессы.

Похожие гайды

Глубокое исследование нейросетью (Deep Research): как заказать отчёт и проверить его

Глубокое исследование - это заказ аналитики, а не длинный ответ чата. Разбираю на прогонах с воркшопов, когда режим нужен, как писать бриф с разрезами, почему исследование не стартует, сколько ждать, как проверять отчёт и чем отличаются ChatGPT и Gemini.

11 мин

Персональные инструкции ChatGPT: как настроить нейросеть под себя один раз

Роль не нужно писать в каждом промпте: один раз прописанные пользовательские инструкции уходят вместе с каждым запросом. Разбираю, где это в ChatGPT сейчас, как собрать роль по промпту-образцу, зачем чистить память и что вынести в проекты.

10 мин

Свой GPT-ассистент: когда собирать и как написать ему инструкцию

Свой ассистент - это инструкция, образцы и проверка, а не кнопка сервиса. Разбираю на своих ассистентах и кейсах с воркшопов, когда его собирать, как писать инструкцию и базу знаний, как проверять и куда переносить после закрытия GPTs в декабре 2026.

11 мин

Голосом в календарь: где нейросеть ошибается с датами и временем

Нейросеть хорошо понимает живую речь и плохо считает даты. На своём боте «голос в календарь» разбираю, почему «в пятницу» уезжает на субботу, где теряется час между сервисами, что делать с «в три» и «в следующую пятницу» и чем заменить подтверждение каждой встречи.

10 мин

Связанные понятия