Коротко
Почему править картинку проще, чем описывать новую?
Когда человек впервые садится генерировать картинку, он воюет с описанием. Пишет три абзаца, получает не то, дописывает уточнения, получает другое не то. Знакомо.
Причина простая: в голове у тебя есть картинка, а у модели - только твой текст. Между ними пропасть, и заполняется она догадками.
Теперь другой сценарий. У тебя есть фотография товара, скан документа, старый слайд или кадр из съёмки. Тебе не нужна новая картинка - нужна эта же, но лучше. Убрать блик, поднять резкость, стереть лишний предмет, перерисовать нечитаемую подпись.
Тут пропасти нет: исходник уже задаёт всё, о чём ты иначе писал бы абзацами. Задача сужается до одного изменения, и результат становится предсказуемым.
Я это заметил на своих же задачах: генерация с нуля - это творческая работа с непредсказуемым числом заходов, а правка существующего - обычная операционная задача на пять минут.
Четыре задачи, которые решаются правкой
| Задача | Что делаешь | Что важно знать |
|---|---|---|
| Увеличить и убрать шум | скан, старое фото, кадр с телефона | специализированный увеличитель обычно точнее универсальной модели |
| Убрать лишний объект | провод, случайный прохожий, логотип чужого сервиса | работает хорошо на однородном фоне, хуже на сложном |
| Починить текст на картинке | плохо пропечатанная подпись, кривые буквы на слайде | надо явно писать, какой текст должен получиться |
| Привести к одному стилю | разнородные фото в презентации или карточках | нужен образец стиля, а не описание словами |
Разница между универсальной моделью и специализированным инструментом - это то, что стоит понять один раз. Универсальная умеет всё понемногу, специализированный увеличитель научен ровно одному и на этом одном выигрывает.
Отдельно про починку текста на картинке. Это единственная из четырёх задач, где надо приносить готовый ответ: если подпись на слайде пропечаталась плохо, напиши модели, что именно там должно быть написано. Иначе она восстановит буквы по форме и выдаст правдоподобную ерунду - технология достраивает похожее, а не читает исходный смысл.
Практический вывод: если задача звучит как «сделай крупнее и чётче», начинай со специализированного инструмента. Если задача звучит как «убери вот это и дорисуй фон» - тут сильнее универсальная модель.
Как вообще выбирать инструмент под тип задачи, разбирал в материале про то, какую нейросеть выбрать под задачу.
Что не получится: честные границы
Тут важно быть честным, потому что обещания в этой области звучат громче реальности.
Что ломается предсказуемо:
- Лица людей. При сильном увеличении черты «поплывут»: инструмент достраивает пиксели, которых в исходнике не было, и получается похожий человек, а не тот же самый.
- Зубы и глаза. Отдельная больная зона по той же причине: мелкая структура достраивается наугад.
- Мелкий текст. Буквы превращаются в правдоподобные закорючки. На беглый взгляд текст, при чтении - бессмыслица.
- Фирменные детали. Логотип, узор, форма упаковки - всё, что должно быть точным, а не похожим.
Как с этим жить: не увеличивать то, что нельзя переснять, если результат пойдёт крупным планом. Для лиц в печати и на большом экране единственный надёжный путь - исходник нормального качества.
И общее правило, которое я формулирую так: качество на выходе определяется качеством на входе. Хороший исходник разгоняется до отличного результата, плохой - до правдоподобного мусора.
Открой результат в полный размер и посмотри на три места: лица, любой текст, фирменные элементы. Именно там ошибки живут и именно их не видно на маленьком превью.
Как сформулировать правку, чтобы не переделал всё?
Главная ошибка формулировки - просить «улучши». Модель понимает это как разрешение переделать всё, и возвращает похожую картинку, в которой поменялось лишнее.
Рабочая структура запроса:
Что именно менять
Одно изменение за раз: «сделай текст в нижней части чётким и читаемым».
Каким должен стать результат
Если правишь текст - напиши его дословно. Модель не обязана угадывать, что там написано.
Что сохранить без изменений
Прямым текстом: «остальные элементы, композицию, цвета и шрифты оставь как есть».
Что убрать
Отдельной строкой, если нужно: «убери водяной знак в правом нижнем углу».
Проверить и повторить точечно
Не переписывать запрос целиком, а указать на конкретное место, которое не устроило.
Формулировка, которая у меня работает как заготовка: «улучши качество изображения там, где буквы плохо пропечатаны, чтобы текст читался чётко; проверь, чтобы в тексте не было ошибок; сохрани все остальные элементы без изменений».
Обрати внимание на последнюю часть. Она выглядит избыточной ровно до первого раза, когда без неё поедут шрифты и цвета.
Приём «референс по стилю»
Описывать стиль словами - неблагодарное занятие. «Минималистично, дорого, с воздухом» каждый понимает по-своему, а модель тем более.
Гораздо надёжнее показать. Берёшь изображение, которое тебе нравится, прикладываешь и говоришь: вот образец стиля, сделай в таком же. Если серия большая - можно точечно: «сделай в стиле второго примера».
Где это выручает:
- Серия карточек товара. Фотографии сняты в разное время и выглядят разнородно.
- Презентация. Иллюстрации из разных источников надо привести к общему виду. Полный пайплайн сборки презентации разбирал отдельно - презентация нейросетями.
- Соцсети. Лента, которая должна выглядеть как одно целое.
Важная оговорка про роли: структуру задаёшь ты, оформление делает модель. Она хороший оформитель и плохой автор замысла. Если ты сам не решил, что должно быть на картинке, никакой образец стиля этого не заменит.
Когда пора начинать новый чат?
Типичная ловушка: картинка почти получилась, но не совсем. Ты просишь поправить, становится хуже. Просишь вернуть как было - возвращается не то. Ещё десять сообщений, и результат уезжает всё дальше.
Механика та же, что и в работе с текстом: в разговоре накопились предыдущие варианты, и каждый следующий ответ опирается на них. Подробно разбирал это в материале про гигиену контекстного окна.
Что делать:
- Останавливайся после третьей неудачной попытки. Не после десятой.
- Забери лучший из полученных вариантов. Он и станет новым исходником.
- Начни чистый разговор. Приложи этот вариант и сформулируй одно оставшееся изменение.
- Не пересказывай историю правок. Она модели не нужна и только сбивает.
Это же правило спасает от бесконечного круга, в который легко попасть с картинками: каждая следующая попытка кажется почти удачной, и остановиться психологически трудно. Ориентир по времени простой - если возишься с одним изображением больше двадцати минут, задача либо не для нейросети, либо требует нормального исходника.
Отдельная бытовая мелочь: если прикладываешь несколько картинок сразу, не грузи их пачкой по два десятка. У сервисов есть ограничения на количество вложений в одном сообщении, и при превышении часть просто не доходит - молча.
Частые вопросы
Частые вопросы
Главный вывод
Главное, что стоит запомнить: нейросеть в задачах с картинками сильна как оформитель и слаба как автор замысла. Дай ей исходник и точное указание - получишь рабочий результат за пять минут.
Практический минимум: правь то, что есть, называй сохраняемое явно, показывай образец стиля вместо описания словами и останавливайся после третьей неудачной попытки.
Посмотри на последнюю картинку, которую пытался сгенерировать с нуля. Не было ли у тебя под рукой исходника, который надо было просто поправить?
