Из чего состоит промпт
Промпт – это описание сцены. Шесть блоков: кто, где, при каком свете, каким объективом, из чего сделано, как скадрировано. Если картинка вышла не та, почти всегда пустует один из шести, и модель заполнила его средним по всему, что видела. Дальше разбираю каждый блок, показываю, как меняется один и тот же кадр, когда блоки добавляются по очереди, и проверяю на живых генерациях четыре совета, которые повторяют все.

Что делает модель, когда вы молчите
Модель не угадывает вашу картинку. Она усредняет все, что видела по вашим словам.
Написали «портрет девушки» – получите среднюю девушку при среднем свете в среднем интерьере. Это не поломка, это честная работа. Вы не сказали – она не придумала.
Отсюда и нейросетевой вид. Он берется не из модели, а из пустых блоков. Восемь признаков, по которым генерацию видно с первого взгляда, я разобрал отдельно в статье «Почему ИИ-картинка выглядит как ИИ». Здесь – причина, а не признаки.
Шесть блоков ниже я не придумал. Это сведенные вместе рекомендации самих производителей. Формулы у них называются по-разному, а состав один и тот же.
Google для Nano Banana Pro называет их subject, action, location, composition, style. Black Forest Labs для FLUX.2 – subject, action, style, context. ByteDance для Seedream раскладывает промпт слоями: format, subject, composition, lighting, text, style, и просит разносить их по отдельным фразам.
Три набора слов, один состав. Свет отдельной строкой есть у ByteDance, оптику подробнее всех расписывает Google, материал называет только он же.
Три компании, которые друг с другом не сговаривались, советуют одно и то же. Значит дело не в моде на промпты, а в том, как эти модели устроены.
Шесть блоков
У каждого одна и та же схема: что это, что будет, если промолчать, что писать и готовая строка-пример.
1. Субъект
Кто или что в кадре и в каком состоянии.
Промолчите – получите усредненного человека в нейтральной позе, лицом в камеру, руки вдоль тела.
Что писать. Возраст, сложение, что делает прямо сейчас, куда смотрит. Состояние важнее внешности – оно задает позу, а поза половину кадра:
женщина 35 лет, худая, в темном шерстяном пальто, оборачивается через плечо, смотрит мимо камеры
Пока не сказано, что человек делает, он будет стоять лицом в камеру.
2. Сцена
Где это происходит и что вокруг.
Промолчите – получите бесконечный серый фон или размытую студию. Это самый частый признак генерации и самый дешевый в починке.
Что писать. Место, время суток, два-три предмета рядом – больше не нужно, лишнее модель потащит в центр внимания:
бетонная лестничная площадка старого завода, окно без стекла, раннее утро, пыль в воздухе
Два предмета и время суток убирают серый фон навсегда.
3. Свет
Тот блок, ради которого я эту статью и пишу.
Свет – это не «светло» или «темно». Это четыре вещи: откуда идет, какого размера источник, какой температуры, насколько жесткий край тени. Блок разобран до конца в отдельном материале: свет в промпте.
Промолчите – получите освещенность вместо света. Он придет отовсюду сразу, обе стороны лица окажутся одинаковой яркости, тени не будет ни от рук, ни от предметов. Кадр выглядит снятым внутри лайтбокса. Ни один настоящий снимок так не выглядит, потому что настоящий снимок сделан при конкретном свете в конкретной комнате.
Что писать. Направление, размер источника, высоту, температуру и, отдельной строкой, есть ли заполнение:
жесткий боковой свет из окна слева, чуть выше уровня глаз, без заполнения, дальняя сторона лица уходит в глубокую тень
Это не мое изобретение. Google в своем руководстве предлагает ровно такой язык: «трехточечная схема с софтбоксом», «светотень с жестким высоким контрастом», «контровой свет золотого часа с длинными тенями». Модели учились на подписанных снимках, и эти слова они знают.
Отсутствие заполнения модель пропускает чаще всего – пишите про него прямо.

4. Оптика и точка съемки
Фокусное расстояние, высота камеры, глубина резкости.
Промолчите – получите усредненный взгляд с уровня груди, где все одинаково резкое от переднего плана до стены.
Что писать. Фокусное и откуда смотрит камера. «35 мм с уровня глаз» и «85 мм чуть сверху» – это два разных человека на одной фотографии: широкий объектив растягивает то, что ближе, длинный сжимает планы и отделяет героя от фона. Выглядит это так:
85 мм, съемка чуть выше уровня глаз, открытая диафрагма, фон уходит в мягкую нерезкость
Black Forest Labs пишет об этом прямым текстом: для фотореализма указывайте камеру, объектив и пленку.
Одно число – фокусное – меняет кадр сильнее, чем десять прилагательных.

5. Материал
Из чего сделано и как оно ведет себя со светом.
Промолчите – получите пластмассу. Все матовое, гладкое, одинаковое: ткань не отличается от бумаги, кожа от резины.
Что писать. Фактуру и то, как поверхность отражает свет – матовая, глянцевая, ворсистая, запотевшая, потертая:
плотная шерсть в крупный рубчик, матовая кожа ботинок с заломами, запотевшее стекло
Google советует то же самое одной фразой: писать «темно-синий твид» вместо «пиджака». Одно слово – и кадр перестает быть каталожным.
Материал – самая дешевая правка: одно слово вынимает кадр из пластмассы.
6. Кадр
Крупность, ориентация и то, где проходят границы.
Промолчите – получите героя ровно посередине, с одинаковым воздухом со всех сторон.
Что писать. План, ориентацию, куда смотрит герой и сколько перед ним места:
поясной план, вертикальный кадр, герой в правой трети, воздух слева по направлению взгляда
Практическое замечание. Композиция хуже всего поддается правке словами: попросите сдвинуть героя – и модель перерисует всю сцену. Проще генерировать с запасом по краям и резать самому.
Кадр – единственный блок, который можно доделать после генерации.

Собираем на одном кадре
Один замысел, шесть генераций. На каждом шаге добавлен ровно один блок, все остальное не тронуто. Видно, что делает каждый.

Не все шесть блоков обязательно описывать словами. Свет, палитру и фактуру, которые трудно сформулировать, проще показать картинкой: как это делается, разобрано в материале про референс вместо описания.
ГлавноеМеняйте по одной вещи за раз. Поменяли пять слов, стало лучше – и вы не знаете, от чего. Значит в следующий раз повторить не сможете.
Четыре совета, которые я проверил
Про промпты пишут много одинакового. Я взял четыре самых частых утверждения и прогнал их на трех моделях: Nano Banana Pro, Seedream 5 Pro, FLUX.2. Между половинами каждой пары менялась ровно одна строка.
«Добавь masterpiece, best quality, 8k – будет качественнее». Не будет. Детализация не выросла ни на одной модели. Зато картинка систематически уходит в теплый золотой контровой свет и глянец: три раза из трех на Nano Banana Pro и три из трех на FLUX.2. Хуже того, эти слова спорят с вашими собственными указаниями: у меня в промпте стоял жесткий боковой свет из окна слева, а со словами качества он уехал в мягкое солнечное заполнение. Вы просите шедевр – и получаете чужое представление о том, как выглядит шедевр, поверх своего.
«Модели не понимают отрицание». Понимают. Я взял сцену, где отрицаемый объект обязан быть по умолчанию: парковка у супермаркета в полдень, «no cars». Ни одной машины ни на одной из трех моделей. Тележки при этом остались – границу понятия модель держит.
Оговорка. Google все равно советует позитивную формулировку: «пустая улица» вместо «улицы без машин». Совет разумный, чем сложнее сцена, тем надежнее описать то, что должно быть. Но подавать это как «модель не понимает частицу не» – неправда.
И не путайте две разные вещи: отдельное поле negative prompt в интерфейсе и слово «без» внутри обычного промпта. У FLUX.2 поля отрицаний нет вообще, это написано в документации. Слово в тексте оно при этом понимает.
«Порядок слов решает». На длинном промпте – возможно, для FLUX.2 это прямо записано в руководстве. На коротком – нет. Я перевернул промпт задом наперед, поставив стиль и оптику первыми, а субъект последним. Все шесть кадров сохранили все элементы. Пока вы пишете два-три предложения, порядок не ваша забота.
«Пиши по-английски, иначе не поймет». Поймет. Одно и то же описание по-русски и по-английски, три модели: свитер серый вязаный, окно, жесткий боковой свет, половина лица в тени – выполнено во всех шести кадрах. Проверял бытовую сцену без узких терминов, за них не ручаюсь.
Про длину отдельно. ByteDance пишет, что длинный промпт рассеивает внимание модели и она начинает терять детали. Из этого практический вывод: если вы добавляете двадцатое уточнение, а картинка не меняется, проблема почти всегда не в нехватке слов, а в противоречии между первыми пятью.
Что ломается
Семь провалов, на которых спотыкаются в первый месяц.
1. Теги вместо сцены. «девушка, красиво, студия, 4k» – это четыре не связанных между собой слова, и связывать их модель будет сама. Пишите предложениями.
2. Мусорные слова качества. Разобраны выше. Они достались нам от моделей 2022 года, где действительно работали.
3. Противоречия внутри промпта. «Мягкий рассеянный свет» и «резкая графичная тень» в одной строке. Модель выберет что-то одно, обычно не то. Перед тем как дописывать, перечитайте – скорее всего вы уже попросили две несовместимые вещи.
4. Слишком длинный промпт. Смотри выше: длина не лечит противоречие.
5. Чужой промпт под другую модель. Формулировки не переносятся один в один, у каждой модели свой уклон. Переносится состав блоков, а не текст.
6. Меняют все сразу. И не знают, что сработало.
7. Делают вывод по одной картинке. Это самое дорогое. Сид – число, которое фиксирует случайность и позволяет повторить кадр в точности, – в большинстве интерфейсов, где эти модели открывают, недоступен. Значит две генерации одного и того же промпта всегда разные. Значит одна картинка не говорит ничего ни о модели, ни о вашей правке – она говорит про одну картинку. Я в этот потолок уперся на первом же опыте: разброс между повторами одного варианта оказался больше разницы между вариантами. Пришлось гонять по три генерации на каждый и смотреть, есть ли систематический сдвиг. Вам столько не нужно, но две-три – нужно всегда.
Готовый шаблон
Скопируйте и заполните. Пустые блоки не оставляйте: то, что не заполнено, заполнит модель:
Субъект: кто, сложение, что делает, куда смотрит.
Сцена: место, время суток, два-три предмета рядом.
Свет: откуда, размер источника, высота, температура, есть ли заполнение.
Оптика: фокусное, высота камеры, глубина резкости.
Материал: фактура главных поверхностей и как они отражают свет.
Кадр: план, ориентация, где герой, куда воздух.
Три примера, заполненных целиком.
Портрет.
Женщина 35 лет, худая, в темном шерстяном пальто, оборачивается через плечо, смотрит мимо камеры.
Бетонная лестничная площадка старого завода, окно без стекла, раннее утро.
Жесткий боковой свет из окна слева, чуть выше уровня глаз, без заполнения, дальняя сторона лица уходит в тень. 85 мм, съемка с уровня глаз, открытая диафрагма.
Плотная шерсть в крупный рубчик, шершавый бетон, пыль в воздухе.
Поясной план, вертикальный кадр, героиня в правой трети.
Предмет.
Керамическая кружка ручной работы, слегка неровная, стоит на дубовом столе.
Мастерская, утро, рядом смятая льняная салфетка.
Один источник сзади и сбоку, свет проходит по краю кружки и оставляет длинную тень на столе. 100 мм макро, диафрагма прикрыта, резкость по ближнему краю.
Матовая глазурь с крапом, некрашеное дерево с порами, мятый лен.
Крупный план, горизонталь, кружка в левой трети, тень уходит вправо.
Интерьер.
Пустая комната с высоким потолком, ничего лишнего, один деревянный стул у стены.
Позднее утро, конец лета, за окном листва.
Свет одним потоком из большого окна справа, четкий прямоугольник на полу, дальний угол в тени. 24 мм с уровня груди, все резко от переднего плана до стены.
Шершавая штукатурка, крашеный дощатый пол, теплое дерево стула.
Общий план, горизонталь, стул в правой трети, воздух слева.
Все остальное – практика.
Вердикт автора
Промпт я собираю в том же порядке, в каком раньше готовил съемку. Сначала кто в кадре и что происходит, потом место, потом свет. Это не теория про блоки: это последовательность решений, которые на площадке принимаются именно так, и переучиваться под нейросеть не пришлось.
Когда правлю чужой промпт, первым делом ищу, чего в нем нет. Обычно нет двух вещей: света и точки съемки. Их дописываю раньше, чем трогаю все остальное, и половина запросов на помощь заканчивается на этом шаге.
Что меня самого удивило за последние два года. Одного селфи с телефона хватает на полноценный студийный лукбук, если промпт назначает все остальное: свет, оптику, материал, кадр. Исходник в этой работе перестал быть главным. Главным стало описание.
И еще. Люди спорят про английский язык, порядок слов и волшебные слова качества, но почти никогда не спорят про то, что в кадре происходит. А проверяемая разница между средним и хорошим кадром лежит именно там.
Частые вопросы
На каком языке писать?
На русском. Проверено на трех моделях: описание сцены по-русски понимается не хуже, чем по-английски. Английский может понадобиться для узких технических терминов, но начинать с него незачем.
Сколько слов нужно?
Два-три предложения на все шесть блоков достаточно для начала. Длиннее – не значит точнее: производитель Seedream прямо пишет, что длинный промпт рассеивает внимание модели.
Промпт переносится на другую модель?
Состав блоков переносится, текст – нет. У каждой модели свой уклон, и одна и та же формулировка дает разный результат. Проверяйте на паре кадров, прежде чем переносить всю библиотеку.
Почему один и тот же промпт дает разные картинки?
Потому что случайность фиксируется сидом, а поля сида в большинстве интерфейсов нет. Каждый запуск заново разыгрывает то, что вы не описали. Чем полнее заполнены блоки, тем меньше разброс.
Ничего не получается, с чего начать?
С блока «свет». Он дает самую заметную разницу и быстрее всего снимает ощущение генерации. Дальше – оптика.