← Назад в блог

Как сделать рилс нейросетью: разбор 4 роликов seemsez, модели и промпты

Автор: SEEMSEZ · 11 сентября 2026 г.

Как сделать рилс нейросетью, чтобы его досматривали, а не пролистывали как очередной ИИ-слоп. Этот гайд построен на четырех роликах, которые мы выпустили в Instagram, Telegram и VK: кальмар моет машину на светофоре, котенок-паук, Maserati в Москва-Сити и Ктулху, вмороженный в айсберг. Каждый собран целиком из генераций, без съемки и монтажера. Внутри: пошаговый метод, какие модели брать, структура промпта, типичные ошибки и полные промпты всех четырех роликов с готовыми видео.

Что понадобится

  • Seedance 2.5. Основная модель для роликов с сюжетом: 15 секунд одним проходом, понимает сценарий с таймкодами, генерирует звук вместе с картинкой, принимает фото-референс героя, стартовый кадр или несколько референс-картинок. Три ролика из четырех сделаны на ней. В seemsez модель открыта на странице Seedance.
  • Kling. Подходит, когда ролик собирается из коротких клипов по 5 секунд под музыку: быстрый и стабильно держит героя по референс-кадру. В seemsez модель открыта на странице Kling.
  • GPT Image. Раскадровки, эталонный кадр героя, стартовый кадр. Держит персонажа по референсу, поэтому серия кадров получается согласованной. В seemsez это страница GPT Image.
  • Референс. Чужой ролик с большими просмотрами, который вы будете не копировать, а перерабатывать. Без него самая частая ошибка: придумать «смешную идею» и получить красивую картинку без сюжета.

Все четыре ролика сделаны на 1080p в вертикали 9:16. 720p дает картинку с плоской «пластиковой» геометрией, поэтому ниже 1080p мы не опускаемся.

Шаг 1. Разобрать референс покадрово

Ролик с миллионами просмотров держится не на картинке, а на механике. Чтобы ее увидеть, референс нужно разобрать по секундам, а не пересказать по памяти.

  • Сколько планов и где склейки. У котенка-паука их всего три: на 4,13, 6,80 и 11,40 секунды, остальное держится движением камеры.
  • Что происходит в каждую секунду и где кульминация. У мойщика на светофоре кульминация не в кальмаре, а в том, что загорается зеленый и поток трогается, как будто ничего не случилось.
  • Что со звуком. У котенка-паука музыка вступает ровно в склейку на 6,8 секунды, и это главный удар ролика.
  • В чем подмена ожидания. У Ктулху во льду зритель ждет, что ролик про косатку, а настоящее раскрытие приходит позже, и между ними реакция героя.

Итог этого шага: один абзац про механику. Не «осьминог у машины», а «мойщик на светофоре, которому нельзя отказать, и никто в пробке не удивляется».

Шаг 2. Переработать, а не скопировать

Механику оставляем, героя и сеттинг меняем. Так ролик не выглядит копией и снимает вопросы с авторскими правами.

  • Кальмар вместо осьминога, российский проспект с панельками и троллейбусными проводами вместо Лос-Анджелеса.
  • Бежевый британский котенок вместо рыжего, водонапорная башня вместо кондиционера, финал над мостом. Костюма человека-паука нет ни в референсе, ни у нас: пародия делается позами и локациями.
  • Москва-Сити и синий Maserati вместо абстрактного суперкара, за рулем своя героиня с фото.
  • Ктулху вместо мегалодона, косатка не нападает, а убегает от айсберга.

Правило проверки: если убрать героя, а ролик остался тем же по структуре и смыслу, переработка сделана правильно.

Шаг 3. Раскадровка в GPT Image, когда она нужна

Раскадровка нужна в двух случаях: герой должен быть узнаваем на протяжении ролика, или есть риск, что модель нарисует что-то мультяшное. В остальных случаях можно идти сразу в видео.

Как делать. Шесть кадров 9:16 под тот же вид, что и будущий ролик, например под телефонную съемку. Кадры генерируются цепочкой: второй кадр пары получает первый как референс, поэтому герой, место и свет совпадают от кадра к кадру. Потом эти кадры уходят в Seedance как референсы.

Что дала раскадровка в ролике с Ктулху: модель получила готовый вид чудовища и повторила его, вместо того чтобы придумать своего. И еще одно: правки дешевле вносить в шесть картинок, чем перегонять видео. Первая версия монстра была скульптурой, вросшей в айсберг снаружи, а нужна была тень внутри мутного льда. Это исправили на картинках за пару минут.

Для героя на серию роликов хватает одного эталонного кадра: сгенерировать его один раз и передавать референсом в каждую генерацию видео. Так сделан котенок-паук: у всех четырех клипов один и тот же кадр котенка в референсах, и зверь не «плывет» между сценами.

Шаг 4. Написать промпт как сценарий

Модель делает ровно то, что написано. Все, чего нет в промпте, она придумает сама, и обычно хуже вас. Поэтому промпт пишется как сценарий, а не как описание идеи. Структура, которая работает во всех четырех роликах:

Структура промпта

1. Вид: photorealistic, found footage с телефона или кино с зерном, вертикаль 9:16, свет и палитра. 2. Один непрерывный план или количество шотов. 3. Герой: одежда, возраст, детали, которые должны держаться весь ролик. Монстров и животных описывать анатомически, а не одним словом. 4. Место: конкретные детали среды, по которым оно узнается. 5. Биты с таймкодами: BEAT 1 (0-1.5s), BEAT 2 (1.5-3s)... В каждом бите действие, крупность, движение камеры и переход к следующему. 6. Звук: что слышно, есть ли речь, нужна ли музыка. 7. NEGATIVE: список запретов. Обязательно: no text, no slow motion, no tripod, no camera equipment.

Промпт пишем на английском: модель точнее понимает термины движения камеры и крупности плана. Короткие реплики героев можно оставлять по-русски.

Три приема, которые видно в промптах ниже.

  • Реакция и есть сюжет. У мойщика каждый шот заканчивается реакцией водителя: орет, смирился, кивает. Без реакций это просто кальмар с губкой.
  • Обыденность прописывается отдельно. Фраза «никто в пробке не удивляется» стоит в промпте явно, иначе модель добавляет зевак с телефонами.
  • Переходы называются словами. У Maserati камера «выходит из отражения на капоте», «ныряет в салон через окно», «уходит в зеркало». Без этих слов модель дает красивые планы, склеенные встык.

Шаг 5. Настроить генерацию

  • Длительность 15 секунд одним проходом, если сюжет линейный. Клипы по 5 секунд только там, где нужны жесткие склейки под музыку.
  • Разрешение 1080p, вертикаль 9:16, генерация звука включена.
  • Референсы. У Seedance 2.5 два режима, и они не совмещаются: либо стартовый кадр, либо референс-картинки. Для режима со стартовым кадром соотношение сторон ставится «adaptive», иначе задача отклоняется.
  • Что выбрать. Стартовый кадр жестко задает первую секунду, но дальше модель свободна. Референсы держат героя и вид на протяжении всего ролика. Для Ктулху мы прогнали оба режима: вариант по трем референсам (герой, вода с силуэтом, крупный план глаз) оказался реалистичнее и ближе к раскадровке.

Шаг 6. Проверить и доработать

Результат смотрится покадрово, а не на глаз. Кадры по секундам сразу показывают, где модель ушла от сценария. Ошибки, которые встречаются чаще всего, и чем они лечатся.

  • Плавающее замедление. Seedance любит slow motion на любом резком действии. Лечится словами explosive, tight, rotation under one second и запретом no slow motion, no hang time, no floating.
  • Съемочная техника в кадре. Под подоконником у котенка появилась голова штатива. В запреты всегда: no tripod, no camera, no photographic equipment.
  • Не тот предмет. Вместо маленьких наушников модель нарисовала накладные с дугой. Предмет описывается физически плюс прямой запрет: small in-ear earphones, absolutely not over-ear headphones, no headband.
  • Смазанный жест. Жест лапой не успевает прочитаться, если бит не расписан по секундам. BEAT 1 (0 to 1 second) и так далее.
  • Герой меняется между клипами. Один эталонный кадр в референсах у каждого клипа.
  • Глюк во второй половине. У Maserati после одиннадцатой секунды модель перепутала перед и зад машины. Резать не стыдно: в эфир ушли 11 секунд из 15.
  • «Сжатое» видео после публикации. Seedance отдает HEVC 10 бит, Telegram такой файл перекодирует в мыло. Перед публикацией конвертируйте в H.264 8 бит.

Пример 1. Мойщик на светофоре

Задача: сюжет из референса про мойщика, герой кальмар, место российский проспект. Один проход Seedance 2.5, 15 секунд, без референс-картинок.

Промпт Seedance 2.5

Photorealistic cinematic commercial, vertical 9:16, sunny afternoon, telephoto lens, handheld documentary feel, subtle film grain. A GIANT SQUID (long torpedo-shaped mantle with triangular fins at the tip, eight arms plus two long feeding tentacles, glossy iridescent red-and-white skin, huge intelligent eye) works as a street windshield washer at a busy traffic light on a wide Russian city avenue: Soviet-era apartment blocks, trolleybus wires, a concrete overpass behind, a long queue of cars waiting at the red light. Beside the squid on the asphalt stand a battered metal bucket of soapy water and yellow sponges on a low rolling cart. SHOT 1 (0-4s): the squid leans over the dusty silver sedan first in the queue and dumps a full bucket of water across its filthy windshield; behind the wet glass the middle-aged driver throws up his hands and shouts in outrage. SHOT 2 (4-9s): several tentacles grab yellow sponges and scrub the windshield, roof and side windows in fast synchronized circles, thick white foam covers the whole car; the driver gives up and sits calmly, resigned. SHOT 3 (9-13s): the squid rinses the car with a second bucket of clean water, foam sluices off, the sedan is spotless, the driver nods and gives a thumbs up. SHOT 4 (13-15s): the traffic light turns green, the queue starts moving, the clean sedan drives away, and the giant squid slides back to the curb beside its bucket, calmly waiting for the next customer. Absolutely deadpan, nobody in the traffic finds a giant squid surprising. Natural daylight, real water and foam physics. No on-screen text.

Мойщик на светофоре: Seedance 2.5, один промпт, 15 секунд

На что смотреть в промпте: анатомическое описание кальмара, четыре шота с таймкодами, реакция водителя в конце каждого шота и отдельная строка про обыденность.

Пример 2. Обычное утро котенка-паука

Задача: пародия на человека-паука с бежевым британским котенком под звук референса. Здесь один проход не подходит: склейки должны попадать в музыку. Четыре клипа Kling по 5 секунд, 1080p, у каждого в референсах один эталонный кадр котенка, сборка под звук оригинала.

Промпт первого клипа, Kling

Vertical cinematic shot, photorealistic, shot on a full frame camera with a fast prime lens. A tiny fluffy beige cream British Shorthair kitten sits upright on a wide old apartment windowsill. Grey overcast morning light. Through the window behind it: city rooftops, water towers and distant skyscrapers, softly out of focus. A thin white curtain hangs at the left edge of frame. Beat one: the kitten sits still and looks straight into the lens. Beat two: it lifts one front paw toward the camera and spreads two toes wide in a playful hang loose gesture, holding the pose. Beat three: a pair of small white wireless earbuds with short stems settle into its ears. Beat four: the kitten tips over backwards and drops straight down out of the bottom of the frame, leaving the windowsill empty and the curtain swaying. CAMERA: locked off, extremely slow push in, no pan, no shake. Shallow depth of field, natural window light, fine fur detail. No text, no captions, no logos, no watermark.

Котенок-паук: четыре клипа Kling, сборка под звук референса

Остальные три клипа написаны по той же схеме: крыша в золотой час и прыжок на паутине, переулок с бельевыми веревками и спуск по стене, свободное падение над мостом с отъездом дрона. Качающаяся штора в первом кадре продает исчезновение котенка лучше любого спецэффекта.

Пример 3. Maserati в Москва-Сити с героиней за рулем

Задача: кино-ролик в формате непрерывной камеры, героиня с фото-референса за рулем. Seedance 2.5 с фото героини в референсах, 15 секунд, в эфир ушли 11.

Промпт Seedance 2.5

Dynamic cinematic supercar reel in Moscow City at dusk with SEAMLESS CREATIVE TRANSITIONS between every shot: the camera never cuts, it FLOWS: it dives, whips and morphs from one shot into the next. Driver: the platinum blonde woman from the reference image (heterochromia: one blue eye, one brown eye). FLOW: 0-2s: FPV drone dive from the top of the glass Moscow City towers, plunging down the mirrored facade, the reflection in the glass MORPHS into the next scene. 2-4s: the camera pulls out of the reflection on the glossy hood of a dark blue Maserati speeding along the embankment. 4-6s: the camera whips around the car in a full 360 orbit while it drives, motion blur streaks of city lights. 6-8s: the camera DIVES THROUGH the open side window into the cabin, landing on the driver, city lights sliding across her face. 8-10s: she flicks the paddle shifter, the camera plunges through the rear-view mirror INTO the reflection: road and glowing towers receding. 10-12s: out of the mirror the camera whips down to the spinning wheel, then slingshots ahead of the car. 12-15s: low front bumper tracking shot, the Maserati accelerates straight at the camera through light trails, the camera rises as the car passes underneath, ending on the skyline. Continuous flowing camera, no hard cuts, heavy speed ramps, photorealistic, vertical 9:16. SOUND: engine roar, whoosh on each transition, bass pulse.

Maserati в Москва-Сити: Seedance 2.5 по фото-референсу, с раскадровкой переходов

Главное в этом промпте: каждый переход назван словами, откуда камера вылетает и куда ныряет. Первая версия без этих слов дала шесть красивых планов, склеенных встык. В ролик для соцсетей вшита раскадровка парами «сцена, сцена», которая сменяется синхронно с переходами: так зритель видит прием, а не только результат.

Пример 4. Ктулху во льду

Задача: найденное видео с телефона, один непрерывный план, двухступенчатое раскрытие. Сначала шесть кадров раскадровки в GPT Image, потом Seedance 2.5 по трем из них как референсам: герой, вода с силуэтом вдали, крупный план глаз. 15 секунд, 1080p, звук сгенерирован.

Промпт Seedance 2.5

Photorealistic FOUND-FOOTAGE smartphone video, vertical 9:16, ONE CONTINUOUS HANDHELD SHOT, no cuts, real phone look with sensor noise. Arctic sea ice edge, dense grey fog, flat overcast light, dark muted blue-grey palette. BEAT 1 (0-1.5s): selfie at arm's length, a bearded Russian polar explorer, mid 40s, grey-streaked frosted beard, orange expedition parka with fur hood, black knit hat, calm, silent, breath steaming. BEAT 2 (1.5-3s): he suddenly turns his head sharply to the side, staring at something on the water; his eyes widen, dread on his face. BEAT 3 (3-4s): he whips the phone around toward the water, fast motion blur. BEAT 4 (4-8s): black still water; in the middle distance only the tall black dorsal fin of an orca cuts the surface, no breaching, the fin moves toward the camera leaving a wake, then sinks. Far behind it in the fog a colossal dark iceberg, and deep inside its murky ice a gigantic DARK BLURRED SILHOUETTE with the vague shape of a huge head and hanging tentacles, only a shadow, no details. BEAT 5 (8-11s): the phone zooms in on the iceberg, shaky digital zoom; the dark mass fills the frame, still just a shadow inside cloudy ice with cracks. BEAT 6 (11-15s): close on the head of the creature inside the ice, tentacles hanging below; above the tentacles TWO eyes of normal size slowly OPEN at the same moment, pale glowing irises with vertical slit pupils, fine cracks spreading through the ice around them. Audio: arctic wind, deep ice cracking, low sub-bass drone, no music, no speech. NEGATIVE: no cuts, no text, no cartoon, no bright colors, no slow motion, no orca jumping, no sculpted stone look, no giant single eye.

Ктулху во льду: Seedance 2.5 по трем референс-кадрам из GPT Image

Что важно: монстр описан как тень, а не как существо с деталями, и это прописано и в промпте, и в референс-кадрах. Косатка ограничена плавником. Порядок «реакция героя до раскрытия» задан битами, а не пожеланием.

Частые вопросы

Сколько стоит сделать такой ролик?

Один проход Seedance 2.5 на 15 секунд в 1080p со звуком стоит несколько сотен рублей в токенах, точная цена показана на странице модели до запуска. На готовый ролик обычно уходит два-три прогона.

Нужно ли уметь монтировать?

Три ролика из четырех ушли в эфир одним файлом без монтажа. Монтаж нужен только там, где склейки должны попадать в музыку.

Можно ли описать идею одной фразой?

Можно, но получится картинка без истории. Сюжет живет в последовательности событий, а она задается только битами с таймкодами.

На каком языке писать промпт?

На английском: модель точнее понимает термины движения камеры и крупности плана. Короткие реплики героев можно оставлять по-русски.

Как удержать одного героя на весь ролик?

Сгенерировать эталонный кадр героя в GPT Image и передавать его референсом в каждую генерацию. Для человека подходит и обычное фото.

Все модели из этого гайда собраны в seemsez, без VPN и с оплатой картой РФ. Промокод IG480S12 дает скидку 10% на любой тариф.

Попробовать в seemsez

Связанные статьи