Дмитрий Анашкин

Улучшить картинку, а не рисовать заново: правка изображений нейросетью

Опубликовано 13 сент. 2026 г.8 мин чтенияНачальный
Улучшить картинку, а не рисовать заново: правка изображений нейросетью
Туториал
Улучшить картинку, а не рисовать заново
Дмитрий Анашкин · 8 мин
Чему вы научитесь
  • Почему правка исходника предсказуемее генерации по описанию
  • Таблица четырёх задач и подходящих под них инструментов
  • Что честно ломается при увеличении: лица, зубы, мелкий текст
  • Структура запроса, который меняет одно место и не трогает остальное
  • Когда пора бросить переписку и начать чистый разговор
Начальный

Коротко

Почему править картинку проще, чем описывать новую?

Когда человек впервые садится генерировать картинку, он воюет с описанием. Пишет три абзаца, получает не то, дописывает уточнения, получает другое не то. Знакомо.

Причина простая: в голове у тебя есть картинка, а у модели - только твой текст. Между ними пропасть, и заполняется она догадками.

Теперь другой сценарий. У тебя есть фотография товара, скан документа, старый слайд или кадр из съёмки. Тебе не нужна новая картинка - нужна эта же, но лучше. Убрать блик, поднять резкость, стереть лишний предмет, перерисовать нечитаемую подпись.

Тут пропасти нет: исходник уже задаёт всё, о чём ты иначе писал бы абзацами. Задача сужается до одного изменения, и результат становится предсказуемым.

Я это заметил на своих же задачах: генерация с нуля - это творческая работа с непредсказуемым числом заходов, а правка существующего - обычная операционная задача на пять минут.

Четыре задачи, которые решаются правкой

ЗадачаЧто делаешьЧто важно знать
Увеличить и убрать шумскан, старое фото, кадр с телефонаспециализированный увеличитель обычно точнее универсальной модели
Убрать лишний объектпровод, случайный прохожий, логотип чужого сервисаработает хорошо на однородном фоне, хуже на сложном
Починить текст на картинкеплохо пропечатанная подпись, кривые буквы на слайденадо явно писать, какой текст должен получиться
Привести к одному стилюразнородные фото в презентации или карточкахнужен образец стиля, а не описание словами

Разница между универсальной моделью и специализированным инструментом - это то, что стоит понять один раз. Универсальная умеет всё понемногу, специализированный увеличитель научен ровно одному и на этом одном выигрывает.

Отдельно про починку текста на картинке. Это единственная из четырёх задач, где надо приносить готовый ответ: если подпись на слайде пропечаталась плохо, напиши модели, что именно там должно быть написано. Иначе она восстановит буквы по форме и выдаст правдоподобную ерунду - технология достраивает похожее, а не читает исходный смысл.

Практический вывод: если задача звучит как «сделай крупнее и чётче», начинай со специализированного инструмента. Если задача звучит как «убери вот это и дорисуй фон» - тут сильнее универсальная модель.

Как вообще выбирать инструмент под тип задачи, разбирал в материале про то, какую нейросеть выбрать под задачу.

Что не получится: честные границы

Тут важно быть честным, потому что обещания в этой области звучат громче реальности.

Что ломается предсказуемо:

  • Лица людей. При сильном увеличении черты «поплывут»: инструмент достраивает пиксели, которых в исходнике не было, и получается похожий человек, а не тот же самый.
  • Зубы и глаза. Отдельная больная зона по той же причине: мелкая структура достраивается наугад.
  • Мелкий текст. Буквы превращаются в правдоподобные закорючки. На беглый взгляд текст, при чтении - бессмыслица.
  • Фирменные детали. Логотип, узор, форма упаковки - всё, что должно быть точным, а не похожим.

Как с этим жить: не увеличивать то, что нельзя переснять, если результат пойдёт крупным планом. Для лиц в печати и на большом экране единственный надёжный путь - исходник нормального качества.

И общее правило, которое я формулирую так: качество на выходе определяется качеством на входе. Хороший исходник разгоняется до отличного результата, плохой - до правдоподобного мусора.

Как сформулировать правку, чтобы не переделал всё?

Главная ошибка формулировки - просить «улучши». Модель понимает это как разрешение переделать всё, и возвращает похожую картинку, в которой поменялось лишнее.

Рабочая структура запроса:

  1. Что именно менять

    Одно изменение за раз: «сделай текст в нижней части чётким и читаемым».

  2. Каким должен стать результат

    Если правишь текст - напиши его дословно. Модель не обязана угадывать, что там написано.

  3. Что сохранить без изменений

    Прямым текстом: «остальные элементы, композицию, цвета и шрифты оставь как есть».

  4. Что убрать

    Отдельной строкой, если нужно: «убери водяной знак в правом нижнем углу».

  5. Проверить и повторить точечно

    Не переписывать запрос целиком, а указать на конкретное место, которое не устроило.

Формулировка, которая у меня работает как заготовка: «улучши качество изображения там, где буквы плохо пропечатаны, чтобы текст читался чётко; проверь, чтобы в тексте не было ошибок; сохрани все остальные элементы без изменений».

Обрати внимание на последнюю часть. Она выглядит избыточной ровно до первого раза, когда без неё поедут шрифты и цвета.

Приём «референс по стилю»

Описывать стиль словами - неблагодарное занятие. «Минималистично, дорого, с воздухом» каждый понимает по-своему, а модель тем более.

Гораздо надёжнее показать. Берёшь изображение, которое тебе нравится, прикладываешь и говоришь: вот образец стиля, сделай в таком же. Если серия большая - можно точечно: «сделай в стиле второго примера».

Где это выручает:

  • Серия карточек товара. Фотографии сняты в разное время и выглядят разнородно.
  • Презентация. Иллюстрации из разных источников надо привести к общему виду. Полный пайплайн сборки презентации разбирал отдельно - презентация нейросетями.
  • Соцсети. Лента, которая должна выглядеть как одно целое.

Важная оговорка про роли: структуру задаёшь ты, оформление делает модель. Она хороший оформитель и плохой автор замысла. Если ты сам не решил, что должно быть на картинке, никакой образец стиля этого не заменит.

Когда пора начинать новый чат?

Типичная ловушка: картинка почти получилась, но не совсем. Ты просишь поправить, становится хуже. Просишь вернуть как было - возвращается не то. Ещё десять сообщений, и результат уезжает всё дальше.

Механика та же, что и в работе с текстом: в разговоре накопились предыдущие варианты, и каждый следующий ответ опирается на них. Подробно разбирал это в материале про гигиену контекстного окна.

Что делать:

  1. Останавливайся после третьей неудачной попытки. Не после десятой.
  2. Забери лучший из полученных вариантов. Он и станет новым исходником.
  3. Начни чистый разговор. Приложи этот вариант и сформулируй одно оставшееся изменение.
  4. Не пересказывай историю правок. Она модели не нужна и только сбивает.

Это же правило спасает от бесконечного круга, в который легко попасть с картинками: каждая следующая попытка кажется почти удачной, и остановиться психологически трудно. Ориентир по времени простой - если возишься с одним изображением больше двадцати минут, задача либо не для нейросети, либо требует нормального исходника.

Отдельная бытовая мелочь: если прикладываешь несколько картинок сразу, не грузи их пачкой по два десятка. У сервисов есть ограничения на количество вложений в одном сообщении, и при превышении часть просто не доходит - молча.

Частые вопросы

Частые вопросы

Главный вывод

Главное, что стоит запомнить: нейросеть в задачах с картинками сильна как оформитель и слаба как автор замысла. Дай ей исходник и точное указание - получишь рабочий результат за пять минут.

Практический минимум: правь то, что есть, называй сохраняемое явно, показывай образец стиля вместо описания словами и останавливайся после третьей неудачной попытки.

Посмотри на последнюю картинку, которую пытался сгенерировать с нуля. Не было ли у тебя под рукой исходника, который надо было просто поправить?

Источники

Отправь другу или себе в избранное в Telegram, чтобы не потерять.

Поделиться в Telegram
Было полезно?
Автор
Дмитрий Анашкин
Практик-интегратор ИИ в бизнес

Основатель NeuroDA и SMAIPL. Корпоративные воркшопы по ИИ, внедрение AI в бизнес-процессы.

Похожие гайды

Инструкция устарела за месяц: как с этим жить

За один прогон обучения материалы дважды разошлись с интерфейсом: пункт настройки переименовали, а нужная команда появилась уже после сборки курса. Разбираю, что устаревает быстрее всего, почему «обновлять чаще» не помогает и как сменить единицу описания, чтобы документ жил годами.

8 мин

Расшифровка записи, которая не уходит в облако

Распознавание речи работает прямо на ноутбуке: файл не покидает диск, интернет нужен один раз для загрузки модели. Разбираю, каким записям облако противопоказано, сколько это стоит по времени, три ограничения подхода и как выбирать между скоростью и точностью текста.

8 мин

Переезд с одной нейросети на другую: что забрать с собой

«Я полгода работал в одном сервисе, он меня уже знает. Перейду на другой - всё насмарку?» Разбираю, что при переезде теряется на самом деле, как забрать у нейросети то, что она о тебе помнит, и почему перевозить надо файлы, а не историю чатов.

7 мин

Голосом быстрее, чем руками: диктовка в работе с ИИ-агентом

Напечатанная задача - восемь слов. Та же задача вслух - четыре важных условия, которые при печати просто не поместились. Разбираю, почему диктовка меняет качество работы с агентом, где она чаще всего ломается и сколько времени можно тратить на починку инструмента.

8 мин

Связанные понятия