# Улучшить картинку, а не рисовать заново: правка изображений нейросетью

Правка изображения предсказуемее генерации с нуля. Разбираю четыре рабочие задачи, честные границы увеличения и формулировку, которая не даёт переделать всё.

URL: https://posts.danashkin.ru/guides/uluchshit-kartinku-a-ne-risovat-zanovo
Обновлено: 2026-09-13

---

## Коротко

**Главное**

- Большинство рабочих задач с картинками - это не генерация с нуля, а правка того, что уже есть: поднять качество, убрать лишний элемент, починить нечитаемый текст, привести к общему стилю.
- Правка проще генерации: у модели уже есть композиция, цвета и содержание, ей не надо угадывать замысел по описанию.
- Главное правило формулировки - явно перечислить, что менять нельзя. Без этого модель перерисовывает картинку целиком и возвращает похожую, но другую.
- Честные границы: лица, зубы, глаза и мелкий текст при увеличении портятся. Это не вопрос выбора инструмента, это текущее состояние технологии.
- Если с третьей попытки картинка не улучшается, дело не в формулировке: разговор засорён предыдущими вариантами, и надо начинать заново.

## Почему править картинку проще, чем описывать новую?

**Главное**

Потому что при правке половина работы уже сделана: композиция, цвета, содержание и настроение заданы исходником. Модели остаётся изменить одно место, а не угадать весь замысел по тексту.

Когда человек впервые садится генерировать картинку, он воюет с описанием. Пишет три абзаца, получает не то, дописывает уточнения, получает другое не то. Знакомо.

Причина простая: в голове у тебя есть картинка, а у модели - только твой текст. Между ними пропасть, и заполняется она догадками.

Теперь другой сценарий. У тебя есть фотография товара, скан документа, старый слайд или кадр из съёмки. Тебе не нужна новая картинка - нужна эта же, но лучше. Убрать блик, поднять резкость, стереть лишний предмет, перерисовать нечитаемую подпись.

Тут пропасти нет: исходник уже задаёт всё, о чём ты иначе писал бы абзацами. Задача сужается до одного изменения, и результат становится предсказуемым.

Я это заметил на своих же задачах: генерация с нуля - это творческая работа с непредсказуемым числом заходов, а правка существующего - обычная операционная задача на пять минут.

## Четыре задачи, которые решаются правкой

**Главное**

Увеличить и очистить, убрать лишнее, починить текст на изображении, привести серию к одному стилю. Это четыре разных инструмента, и путать их дорого: универсальная модель проигрывает специализированной там, где нужна точность.

| Задача | Что делаешь | Что важно знать |
|---|---|---|
| Увеличить и убрать шум | скан, старое фото, кадр с телефона | специализированный увеличитель обычно точнее универсальной модели |
| Убрать лишний объект | провод, случайный прохожий, логотип чужого сервиса | работает хорошо на однородном фоне, хуже на сложном |
| Починить текст на картинке | плохо пропечатанная подпись, кривые буквы на слайде | надо явно писать, какой текст должен получиться |
| Привести к одному стилю | разнородные фото в презентации или карточках | нужен образец стиля, а не описание словами |

Разница между универсальной моделью и специализированным инструментом - это то, что стоит понять один раз. Универсальная умеет всё понемногу, специализированный увеличитель научен ровно одному и на этом одном выигрывает.

Отдельно про починку текста на картинке. Это единственная из четырёх задач, где надо приносить готовый ответ: если подпись на слайде пропечаталась плохо, напиши модели, что именно там должно быть написано. Иначе она восстановит буквы по форме и выдаст правдоподобную ерунду - технология достраивает похожее, а не читает исходный смысл.

Практический вывод: если задача звучит как «сделай крупнее и чётче», начинай со специализированного инструмента. Если задача звучит как «убери вот это и дорисуй фон» - тут сильнее универсальная модель.

Как вообще выбирать инструмент под тип задачи, разбирал в материале про то, [какую нейросеть выбрать под задачу](/guides/kakuyu-neyroset-vybrat-pod-zadachu).

## Что не получится: честные границы

**Главное**

Лица, зубы, глаза и мелкий текст при увеличении портятся - инструмент дорисовывает недостающие детали и промахивается. Это ограничение технологии, а не настройка, которую можно найти.

Тут важно быть честным, потому что обещания в этой области звучат громче реальности.

Что ломается предсказуемо:

- **Лица людей.** При сильном увеличении черты «поплывут»: инструмент достраивает пиксели, которых в исходнике не было, и получается похожий человек, а не тот же самый.
- **Зубы и глаза.** Отдельная больная зона по той же причине: мелкая структура достраивается наугад.
- **Мелкий текст.** Буквы превращаются в правдоподобные закорючки. На беглый взгляд текст, при чтении - бессмыслица.
- **Фирменные детали.** Логотип, узор, форма упаковки - всё, что должно быть точным, а не похожим.

Как с этим жить: не увеличивать то, что нельзя переснять, если результат пойдёт крупным планом. Для лиц в печати и на большом экране единственный надёжный путь - исходник нормального качества.

И общее правило, которое я формулирую так: качество на выходе определяется качеством на входе. Хороший исходник разгоняется до отличного результата, плохой - до правдоподобного мусора.

**Проверка перед сдачей**

Открой результат в полный размер и посмотри на три места: лица, любой текст, фирменные элементы. Именно там ошибки живут и именно их не видно на маленьком превью.

## Как сформулировать правку, чтобы не переделал всё?

**Главное**

Назвать, что изменить, и отдельно - что сохранить без изменений. Второе важнее первого: без явного запрета модель перерисовывает картинку целиком.

Главная ошибка формулировки - просить «улучши». Модель понимает это как разрешение переделать всё, и возвращает похожую картинку, в которой поменялось лишнее.

Рабочая структура запроса:

1. **Что именно менять**

   Одно изменение за раз: «сделай текст в нижней части чётким и читаемым».

2. **Каким должен стать результат**

   Если правишь текст - напиши его дословно. Модель не обязана угадывать, что там написано.

3. **Что сохранить без изменений**

   Прямым текстом: «остальные элементы, композицию, цвета и шрифты оставь как есть».

4. **Что убрать**

   Отдельной строкой, если нужно: «убери водяной знак в правом нижнем углу».

5. **Проверить и повторить точечно**

   Не переписывать запрос целиком, а указать на конкретное место, которое не устроило.

Формулировка, которая у меня работает как заготовка: «улучши качество изображения там, где буквы плохо пропечатаны, чтобы текст читался чётко; проверь, чтобы в тексте не было ошибок; сохрани все остальные элементы без изменений».

Обрати внимание на последнюю часть. Она выглядит избыточной ровно до первого раза, когда без неё поедут шрифты и цвета.

## Приём «референс по стилю»

**Главное**

Вместо описания стиля словами дай образец. Модель считывает из картинки то, что человек не умеет формулировать: воздух, контраст, ритм, толщину линий.

Описывать стиль словами - неблагодарное занятие. «Минималистично, дорого, с воздухом» каждый понимает по-своему, а модель тем более.

Гораздо надёжнее показать. Берёшь изображение, которое тебе нравится, прикладываешь и говоришь: вот образец стиля, сделай в таком же. Если серия большая - можно точечно: «сделай в стиле второго примера».

Где это выручает:

- **Серия карточек товара.** Фотографии сняты в разное время и выглядят разнородно.
- **Презентация.** Иллюстрации из разных источников надо привести к общему виду. Полный пайплайн сборки презентации разбирал отдельно - [презентация нейросетями](/guides/prezentaciya-neyrosetyami-payplayn).
- **Соцсети.** Лента, которая должна выглядеть как одно целое.

Важная оговорка про роли: структуру задаёшь ты, оформление делает модель. Она хороший оформитель и плохой автор замысла. Если ты сам не решил, что должно быть на картинке, никакой образец стиля этого не заменит.

## Когда пора начинать новый чат?

**Главное**

Когда с третьей попытки результат не приближается к нужному. Разговор уже забит неудачными вариантами, и модель тянет их за собой. Новый чат с исходником и одной точной формулировкой обычно решает быстрее.

Типичная ловушка: картинка почти получилась, но не совсем. Ты просишь поправить, становится хуже. Просишь вернуть как было - возвращается не то. Ещё десять сообщений, и результат уезжает всё дальше.

Механика та же, что и в работе с текстом: в разговоре накопились предыдущие варианты, и каждый следующий ответ опирается на них. Подробно разбирал это в материале про [гигиену контекстного окна](/guides/gigiena-kontekstnogo-okna).

Что делать:

1. **Останавливайся после третьей неудачной попытки.** Не после десятой.
2. **Забери лучший из полученных вариантов.** Он и станет новым исходником.
3. **Начни чистый разговор.** Приложи этот вариант и сформулируй одно оставшееся изменение.
4. **Не пересказывай историю правок.** Она модели не нужна и только сбивает.

Это же правило спасает от бесконечного круга, в который легко попасть с картинками: каждая следующая попытка кажется почти удачной, и остановиться психологически трудно. Ориентир по времени простой - если возишься с одним изображением больше двадцати минут, задача либо не для нейросети, либо требует нормального исходника.

Отдельная бытовая мелочь: если прикладываешь несколько картинок сразу, не грузи их пачкой по два десятка. У сервисов есть ограничения на количество вложений в одном сообщении, и при превышении часть просто не доходит - молча.

## Частые вопросы

**Главное**

Что спрашивают чаще всего: можно ли обойтись подпиской без дополнительных сервисов, что делать с фотографиями людей, годится ли это для печати и как быть с чужими изображениями.

### Частые вопросы

**Хватит ли обычной подписки на нейросеть?**

Для правок и лёгкого увеличения - да. Отдельные инструменты нужны, когда важен большой размер под печать или крупный экран: у универсальных моделей разрешение на выходе обычно ограничено.

**Можно ли улучшать фотографии сотрудников и клиентов?**

Технически да, но помни про два ограничения: лица портятся при сильном увеличении, а изображение человека - это его персональные данные. Для внешних материалов нужно согласие, и это не формальность.

**Годится ли результат для печати?**

Смотря что печатаешь. Для внутренних материалов обычно да. Для наружной рекламы и полиграфии с лицами крупным планом - нет: там нужен исходник в нужном разрешении.

**Что с чужими картинками из интернета?**

Правка не делает изображение твоим. Если картинка чужая, вопрос прав остаётся ровно там же, где был. Для коммерческих материалов бери сток с понятной лицензией или собственную съёмку.

## Главный вывод

**Главное**

В рабочих задачах правка существующего изображения даёт результат быстрее и предсказуемее генерации с нуля. Ключ к ней - явный запрет менять всё остальное и трезвое понимание границ технологии.

Главное, что стоит запомнить: [нейросеть](/concepts/ai-agent) в задачах с картинками сильна как оформитель и слаба как автор замысла. Дай ей исходник и точное указание - получишь рабочий результат за пять минут.

Практический минимум: правь то, что есть, называй сохраняемое явно, показывай образец стиля вместо описания словами и останавливайся после третьей неудачной попытки.

Посмотри на последнюю картинку, которую пытался сгенерировать с нуля. Не было ли у тебя под рукой исходника, который надо было просто поправить?

### Источники

- [Image scaling - как работает увеличение изображений, Википедия](https://en.wikipedia.org/wiki/Image_scaling)
- [Inpainting - дорисовка недостающих частей изображения, Википедия](https://en.wikipedia.org/wiki/Inpainting)
- [Text-to-image model - как модели превращают описание в картинку, Википедия](https://en.wikipedia.org/wiki/Text-to-image_model)
- [Optical character recognition - распознавание текста на изображениях, Википедия](https://en.wikipedia.org/wiki/Optical_character_recognition)
