Консистентный персонаж без дообучения
Личность держит картинка, а не слова. Вы делаете один эталонный портрет героя, дальше в каждой генерации отдаете этот файл как референс персонажа и пишете новую сцену. Человек повторяется. Ни обучения, ни двадцати фотографий, ни LoRA для этого не нужно.
Дальше начинается настоящая работа: понять, где такой способ держит, а где отпускает. Я прогнал одну героиню на тридцати кадрах от одного эталона и разобрал каждый.

Почему словами не выходит
Описание внешности не задает личность. Оно задает типаж.
Я написал промпт: женщина около тридцати, темные волосы до плеч, зеленые глаза, черная рубашка, бетонная стена, жесткий свет слева. Отправил дважды, слово в слово. Вернулись две разные женщины: разный овал лица, разный нос, разный возраст.
Так работает любая текстовая модель. Промпт задает область, внутри которой бесконечно много подходящих лиц, и на каждой генерации выбирается новое. Чем подробнее описание, тем область уже, но в точку она не сходится никогда. Я пробовал и подробный словесный портрет: родинка над бровью, узкий нос с горбинкой, веснушки на скулах, широко расставленные глаза. Две генерации дали двух женщин, похожих как сестры. Сестры, а не один человек.
Это самая дорогая иллюзия первой недели. Кажется, что нужно дописать еще пять признаков, и лицо зафиксируется. Не зафиксируется. Про то, что промпт вообще умеет и чего не умеет, есть отдельный разбор устройства промпта по блокам.
Словами вы заказываете типаж. Личность заказывается картинкой.

Эталонный кадр
Все дальнейшее пляшет от одного файла. Его стоит сделать отдельно и не жалеть на него времени: он будет участвовать в каждом кадре серии месяцами.
Что должно быть в эталоне.
- Лицо крупно. Поясной портрет или голова с плечами. С общего плана снять нечего.
- Анфас или легкие три четверти. С профиля работать нечем: половина признаков лица в нем не видна, и модель достроит их сама.
- Читаемый свет с одной стороны. Ровное освещение со всех сторон убирает объем, и модели нечего запоминать. Жесткая боковая тень, наоборот, показывает форму носа и скул.
- Нейтральное выражение. Улыбка и прищур деформируют лицо, и модель запомнит деформацию как черту.
- Ничего лишнего на лице. Без очков, без челки поперек глаз, без руки у щеки.
- Высокое разрешение. Пережатый скриншот отдает кашу вместо кожи.
Эталон выбирается, а не берется первым попавшимся. Я сделал тринадцать портретов героини на Soul 2.0, прежде чем взял один. Главная правка по дороге оказалась не про свет и не про кадрирование, а про типаж: первые попытки давали коммерчески красивое лицо, годное для рекламы крема и бесполезное для серии. Пришлось описать кастинг подробно: узкое вытянутое лицо, впалые щеки, острые скулы, глубоко посаженные глаза, тонкий рот, своя бровь, бледная кожа без загара. Характерное лицо держится лучше усредненно-красивого, потому что модели есть за что зацепиться.
Если героя нужно показать в полный рост и со спины, к портретному эталону добавляется второй кадр с фигурой. Про то, что вообще умеет загруженная картинка и какие у нее бывают роли, я писал в материале референс вместо описания.
Как отдать эталон модели
Кнопка загрузки одна, а роль у файла нужна конкретная: персонаж. Названия у разных сервисов разные, механика одна.
Midjourney. Omni Reference: параметр --oref со ссылкой на картинку и вес --ow. Диапазон веса от 1 до 1000, по умолчанию 100. Вендор советует держать ниже 400, иначе результат становится непредсказуемым, и дает два ориентира: --ow 25, когда меняется стиль изображения, и --ow 400, когда лицо и одежда обязаны сохраниться точно. Прежний --cref остался в шестой версии. Учтите, что --stylize и --exp спорят с референсом за влияние на кадр.
Nano Banana Pro. Референсы кладутся списком: до 5 персонажей и до 14 объектов в одной задаче. Отдельного ползунка силы нет, роль задается словами промпта.
FLUX.2. До 10 референсов на генерацию, роли разводятся между персонажем, стилем и композицией.
Grok Imagine. До 5 входных изображений в одной генерации.
Seedream 5. Мультиреференсы есть, точный максимум для версии Pro вендором не подтвержден.
В сервисах-надстройках вроде Higgsfield к этому добавлен свой слой. Загруженное лицо сохраняется как элемент и потом подставляется в генерации разными моделями, включая Nano Banana Pro, GPT Image 2, Seedream и видеомодели. Обучения это не требует, элемент создается из одной картинки.
Первое, что нужно проверить в интерфейсе: где здесь роль «персонаж» и есть ли регулятор силы. Если ползунка нет, роль называется словами: «сохрани лицо человека с приложенной фотографии, поменяй сцену».
Тридцать кадров одной героини
Я взял один эталон и сделал тридцать генераций. Промпт у всех тридцати одинаковый целиком, включая описание света, оптики и фактуры; меняется ровно блок сцены. Каждый кадр делался от эталона, ни один от предыдущего кадра. Модель во всех тридцати одна: Nano Banana Pro через Higgsfield.
Оси прогона: крупность от макро до общего плана, ракурс от анфаса до профиля и съемки снизу, свет от жесткого бокового до контрового и подсветки экраном, эмоция от покоя до крика, внешние перемены вроде мокрых волос, пучка, темных очков и вечернего макияжа, плюс широкоугольная оптика вплотную и черно-белый кадр.

Разбор по итогам. Я разложил тридцать кадров на четыре стопки.
Пятнадцать держатся без оговорок. Поясные и средние планы анфас и в три четверти, боковой жесткий свет, полуденное солнце, оборот через плечо, запрокинутая голова, макро на глаза, ночной цветной свет, свет от свечи, движение, мокрые волосы, тугой пучок, отражение в стекле, героиня в толпе, теплый интерьер кафе, черно-белый кадр. Эти я поставил бы в серию как есть.
Пять держатся с оговорками. Полный рост, съемка сверху, контровой закат, пасмурный ровный свет, широкий угол вплотную. Человек тот же, но черты плывут: лицо то смягчается, то тяжелеет. В серию пойдут после отбора из нескольких попыток.
Семь уехали. Строгий профиль, съемка снизу, подсветка снизу от экрана, смех в голос, крик, вечерний макияж, капюшон с шарфом. На этих кадрах в серию попадет другой человек.
Три оценить нельзя. Общий и очень общий план, где лицо занимает несколько десятков точек, и кадр в темных очках. Там просто нет признаков, по которым узнают.
Это результат второго прогона. Первый я делал на эталоне со случайным типажом и без единого промпта: там держались восемь кадров из тридцати, а не пятнадцать. Разницу дали две вещи: характерное лицо на эталоне и одинаковый промпт во всех кадрах, где меняется только сцена.
Отдельное наблюдение не про лицо. Сцену «снято сверху, героиня лежит на полу» модель проигнорировала оба раза и отдала обычный портрет у стены. Референс тянет кадр к своей геометрии, и сложный ракурс проще получить без него, а лицо потом починить правкой.
Где лицо уезжает
Причины сводятся к четырем.
Ракурс, которого нет в эталоне. Профиль и съемка снизу требуют информации, которой в эталонном анфасе просто нет. Модель достраивает недостающую половину головы по своим представлениям, и получается родственник. Лечится вторым эталоном: тот же человек в профиль и в три четверти.
Свет, который стирает форму. Ровный пасмурный свет и жесткое солнце сверху одинаково убивают узнаваемость, только с разных сторон. Первый убирает тени и вместе с ними форму носа и скул. Второй заливает глазницы черным, и глаза перестают читаться. Правило здесь простое: чем понятнее в кадре источник света, тем крепче держится личность.
Сильная эмоция. Крик и смех перестраивают нижнюю треть лица: челюсть, губы, щеки. Модель считает это разрешением перерисовать лицо целиком. Это самая частая беда в сериях, где герой должен реагировать.
Все, что закрывает или переписывает лицо. Темные очки, шарф, густой макияж, широкий угол в полуметре от носа. Здесь нечему держаться: признаки либо спрятаны, либо искажены оптикой.
ГлавноеПроверка на минуту: посмотрите на эталон и спросите, видно ли на нем то, что вы заказываете в новой сцене. Если заказываете профиль, а на эталоне анфас, вы просите модель придумать.
Серия собирается от эталона, а не по цепочке
Самая дорогая ошибка серии выглядит разумно. Получился кадр, он нравится, и следующий кадр делается по нему. Потом третий по второму. Потом четвертый.
Каждая генерация подмешивает свое. Сдвиг за один шаг незаметен, и заметить его трудно: вы смотрите на переходы, а не на концы. К концу цепочки герой уже другой, хотя ни один отдельный шаг не выглядел неправильным.
Я проверил это той же героиней. Семь шагов цепочки: комната, улица, кафе, ночная парковка, лестница, светлая комната, снова лестница. Каждый следующий кадр делался от предыдущего. Рядом тот же финальный кадр, сделанный напрямую от эталона.
За семь шагов от героини осталась родственница. Лицо постарело, под глазами легли тени, брови сменили форму, губы стали тоньше, взгляд другой. По отдельности каждый шаг выглядел нормально: на своем кадре никакой ошибки не видно. Видно ее только на концах.

Правило простое: эталон один и он не меняется. Все кадры серии делаются от него. Если пришлось сделать кадр от кадра, следующий все равно возвращается к эталону.
Цепочка правок это тихий дрейф. Каждый шаг выглядит безобидно, а концы не сходятся.
Что делать, когда лицо уехало
Порядок действий по стоимости, от дешевого к дорогому.
- Повторить генерацию с тем же эталоном. Разброс между попытками большой, и часто вторая попытка уже годится. На спорной сцене я сразу делаю три-четыре кадра и выбираю.
- Приблизить кадр. Чем крупнее лицо в кадре, тем больше внимания достается лицу. Общий план почти всегда отдает чужого человека.
- Упростить сцену. Уберите из промпта то, что перестраивает лицо: крик, очки, тяжелый макияж, экстремальный ракурс. Верните по одному и найдите, что именно ломало.
- Починить лицо правкой по образцу. Берете полученный кадр, отдаете вместе с эталоном и просите поменять только лицо, оставив позу, свет и кадрирование. Это дешевле перегенерации: сцена сохраняется целиком.
- Сменить эталон. Если лицо уезжает на половине сцен, дело не в сценах. Сделайте другой эталонный портрет: крупнее, светом понятнее, выражением спокойнее.
Когда без обучения не обойтись
Референс покрывает большинство задач, но не все. Обучение личности имеет смысл в двух случаях: героя нужно снимать месяцами, и кадров нужны сотни.
Soul ID в Higgsfield. Интерфейс просит от 5 до 20 фотографий одного человека, обучение занимает около десяти минут. Блог вендора советует брать 20 кадров и больше, с разными ракурсами и выражениями, при ровном свете и без очков. Обученная личность работает только с моделями Soul, и в одной генерации она может быть только одна: двух обученных героев в кадр не поставить.
LoRA. Классическое дообучение под открытые модели. Требует 15-30 изображений и часов работы видеокарты. Дает лучший результат на выраженной внешности и на длинной дистанции.
Граница проходит по объему. Пять кадров для поста собираются референсом за полчаса. Годовой герой бренда, у которого будет двести кадров и видео, окупает обучение.
При этом обучение не отменяет всего, что написано выше. Ракурс, которого не было в обучающих кадрах, поедет и там.
Что ломается
Референс притащил не только лицо. Вместе с личностью переехали поза, одежда и фон эталона. Причина в силе влияния: она выкручена вверх или роль референса не названа, и модель поняла файл как основу кадра. Опустите вес, назовите роль, а в промпте прямо напишите новую позу и новое место.
Все кадры серии стали одинаковыми. Обратная сторона той же настройки. Герой узнается, но серия выглядит как один кадр, снятый пять раз. Держите личность референсом, а разнообразие задавайте сценой: другое место, другой свет, другая крупность.
Модель приняла одежду за часть личности. Эталон в черной рубашке, и черная рубашка лезет во все кадры. Пишите одежду в промпте явно, иначе она берется с картинки.
Прическа держится крепче лица. Смена длины волос сбивает узнаваемость сильнее, чем смена света. Если герою нужны разные прически, делайте отдельный эталон на каждую.
Два персонажа одним референсом. Один файл держит одну личность. Двое в кадре собираются двумя референсами, и не всякая модель это умеет. Обученная личность в Higgsfield в паре вообще не работает, там нужны элементы.
Возраст плывет в сторону молодости. На кадрах с мягким и теплым светом героиня стабильно молодела. Модели тянет к гладкой коже. Просите возраст в промпте словами и требуйте фактуру кожи: поры, морщины, неровный тон.
Запрет на текст держится не всегда. В первом прогоне модель нарисовала светящуюся вывеску с надписью в ночном кадре и повесила логотип бренда на куртку прохожего в кадре с толпой. Оба раза в промпте стояло «без текста и логотипов». Во втором прогоне на тех же сценах этого не случилось ни разу: помогла не сила запрета, а то, что сцена стала подробнее и модели было чем занять кадр. Смотрите каждый кадр глазами перед публикацией.
Посредник может подменить модель. Я отправлял задания в Nano Banana Pro, а в журнале генераций они помечены как Nano Banana 2. Для статьи это мелочь, для сравнения моделей нет. Проверяйте, что именно исполнило ваш запрос.
Мой вердикт
Референс закрывает задачу серии для брендового контента. Тридцать кадров показали ровно то, что я видел на съемках: узнаваемость держится, пока лицо освещено понятным светом, повернуто к камере и занимает заметную часть кадра. Как только начинается кино, узнаваемость платит.
Что я делаю сам. Эталон снимаю отдельно и с запасом: анфас и три четверти, один жесткий боковой свет, спокойное лицо. Серию собираю только от него. Сцены, где нужны крик, профиль или общий план, планирую заранее и на них закладываю больше попыток. Обучение личности беру, когда герой живет дольше одного проекта.
Чего не делаю. Не пишу словесный портрет вместо картинки. Не строю серию цепочкой правок. Не спорю с кадром, где лицо уехало на общем плане: там лица нет и не будет.
Вердикт автора
Частые вопросы
Сколько кадров подряд держится один персонаж?
Считать надо не кадры, а условия. Кадры не портятся от количества, если каждый делается от эталона. Портятся от смены ракурса, света и эмоции.
Можно ли взять эталоном свою фотографию?
Да, механика та же. Требования к кадру те же: лицо крупно, свет с одной стороны, спокойное выражение.
Работает ли это в видео?
Частично. Стартовый кадр держится, дальше личность плывет по мере движения. Для видео лицо надежнее закреплять обученной личностью, а не одним референсом.
Сколько попыток закладывать на кадр?
На простой сцене одну-две. На сцене с эмоцией, сложным ракурсом или необычным светом я закладываю три-четыре и выбираю. В моем прогоне второго захода потребовали двенадцать кадров из тридцати.
Почему у меня один и тот же промпт дает разные лица даже с референсом?
Референс задает лицо, а не фиксирует его. Разброс между попытками остается всегда. Поэтому спорную сцену делают в три-четыре захода и выбирают лучший кадр.