как я собираю видео с LTX 2.3 и почему новый trainer для LTX 2.3 заметно меняет весь процесс
Когда Lightricks выкатили новый trainer для LTX 2.3, у меня сразу появилось то самое чувство, которое бывает перед хорошим рабочим экспериментом: задача понятна, но внутри уже виден простор для аккуратной сборки. Меня зацепило само обновление и то, что теперь весь путь обучения IC Laura и Laura стал заметно прямее. Меньше лишних развилок, понятнее структура, удобнее добираться до результата, особенно если вы работаете с видео и хотите получить стабильные контрольные точки без лишней возни.
А если вы, как и я, часто собираете разные нейросетевые инструменты под конкретные задачи, очень выручает Бот SozdavAI. Я сама периодически захожу туда, когда нужно быстро переключиться между текстом, фото и видео без лишней беготни по отдельным сервисам. Это ощущается как один рабочий стол вместо россыпи вкладок: всё в одном месте, проще держать темп и не расползаться по подпискам. После этого возвращаюсь к LTX 2.3, потому что здесь особенно интересно смотреть, как новый trainer влияет на качество моделей и на то, насколько предсказуемо ведёт себя весь конвейер.
что изменилось в LTX 2.3
Если смотреть на сам репозиторий LTX 2, там уже видно, что обновление не косметическое. В папке packages лежат LTX core, LTX pipeline и LTX trainer. Первый отвечает за основной код модели, второй нужен для генерации видео на Python, а третий используется для создания Laura-моделей под LTX 2.3.
Меня в таких обновлениях всегда интересует не список папок, а то, как это отражается на практике. Здесь новый trainer получил полностью обновлённую кодовую базу и умеет работать с аудио, видео, а также с обучением по схеме аудио плюс видео для IC Laura. То есть можно собирать видео только по движению, только по звуку или объединять оба канала. Для тех, кто строит более сложные сценарии, это уже не мелочь, а важная развилка.
Ещё один любопытный момент — в репозитории появились инструкции для агентов. Там есть папка skills с файлами skill.md, и они написаны не для человека, который листает текст глазами, а для искусственного интеллекта, который должен вести процесс по шагам. Это другая логика работы: не вы вручную вспоминаете, как подготовить набор данных и какой формат задать, а агент проводит вас через подготовку, настройку и запуск обучения.
как устроен новый конвейер обучения
Внутри этих инструкций агенту объясняется, как собрать набор данных, какие видео брать, как оформить конфигурацию и как запустить сам процесс. И это не одна универсальная схема на все случаи. Для разных задач, будь то видео к видео, аудио к видео или изображение к видео, ему задаются разные форматы данных и разные требования.
Я хорошо понимаю, почему этот подход сейчас быстро приживается. Когда вы делаете не одну модель, а несколько вариантов под разные сценарии, ручная настройка начинает тормозить сильнее всего. Мне самой доводилось тратить уйму времени не на идею, а на рутину вокруг неё. Поэтому здесь мне нравится логика Lightricks: они заранее сняли с человека кусок скучной работы и передали её агенту, который не устает и не забывает последовательность шагов.
Но если честно, для меня самым интересным в этой истории всё равно оказался trainer, а модель Ingredients, потому что на ней лучше всего видно, как новая схема обучения отражается на качестве выхода.
почему Ingredients сейчас выглядит самым сильным вариантом
На странице Creative Lab у Ingredients сейчас больше всего внимания: у него больше сохранений и загрузок, чем у остальных новых вариантов. И причина понятна без лишних объяснений. В одном референс-листе можно собрать персонажей, предметы и локацию, а потом использовать это как основу для видео. Это очень удобный способ задать сцену целиком, а не разбрасывать элементы по разным заготовкам.
Я бы описала это так: вы собираете аккуратную визуальную карту кадра, а модель потом читает её как рабочую схему. Для видео это особенно полезно, когда нужно удержать героев и окружение в одном стиле. Если у вас в голове есть чёткая сцена, Ingredients позволяет перенести её в более управляемую форму.
как я делаю референс-лист для Ingredients
Перед генерацией видео нужен сам референс-лист. В идеале это сетка 2 на 2 или 3 на 3, где персонажи, предметы и окружение разложены по отдельным ячейкам. Здесь очень удачно подошёл Ideogram 4, потому что он хорошо справляется с такими композициями.
Например, можно собрать в одной сетке киберпанк-хакера, полу-роботизированного персонажа с механическими руками, отдельные предметы для каждого героя и фон в виде улицы в стиле киберпанк. Из таких фрагментов потом и получается удобная основа для Ingredients. Сетка должна быть читаемой, иначе модель будет путаться в том, что к чему относится.
У Ideogram 4 появились новые плагины и пользовательские узлы, и там есть, например, Ideogram for prompt builder KJ node. Он позволяет вручную задавать ограничивающие области для отдельных зон изображения. Это рабочий вариант, но я в таких задачах обычно ищу способ быстрее. Ручная сборка слишком быстро съедает время.
Поэтому я бы пошла по более короткому пути: использовать языковую модель, чтобы она сама собрала JSON-структуру с нужными блоками. Я так и делаю, когда нужен аккуратный макет без лишней ручной возни. Вы просто задаёте, какие элементы должны быть на листе, а дальше модель формирует структурированный JSON с расположением, описанием и ячейками. Если удобно, можно взять шаблон JSON прямо из встроенных шаблонов Ideogram в ComfyUI и показать его языковой модели как образец. Тогда формат получается ровнее с первого раза.
почему такой референс-лист работает лучше
Я проверяла похожие схемы в своей работе и заметила одну простую вещь: чем яснее разделены роли элементов, тем меньше потом приходится исправлять видео на выходе. Когда персонажи, предметы и фон не смешаны в одной каше, модель держит композицию заметно спокойнее. Для Ingredients это особенно важно, потому что здесь весь смысл в том, чтобы сцена читалась как связный набор опорных точек.
Поэтому мне нравится подход с отдельными панелями. Это почти как раскадровка, только в более жёстком и структурированном виде. Вы не просите модель догадаться, что где находится, а прямо показываете ей архитектуру сцены.
другой пример: как я готовила сцену с персонажами на мостике корабля
Во втором случае я собрала референс-лист для сцены с инопланетной принцессой и человеком-пилотом в кабине космического корабля. Такой лист сразу уходит в workflow Ingredients, и дальше начинается самое интересное.
Сначала загружается сама картинка-основа. Потом нужны правильно оформленные текстовые подсказки. И вот здесь у Ingredients есть жёсткое требование к структуре. Первый блок описывает каждый элемент в референс-листе: какая ячейка кому соответствует, где находится персонаж, где предмет, где окружение. Второй блок описывает то, что должно происходить в самом видео: движение камеры, действия героев, их взаимодействие, возможные реплики.
Этот формат кажется тяжеловатым только до тех пор, пока вы не начнёте собирать его регулярно. После этого становится ясно, что логика у него вполне рабочая. Один блок отвечает за опору, второй — за динамику. И модель не путается, что именно ей нужно удерживать.
как я ускоряю составление подсказок
Ручное написание такого текста отнимает слишком много времени, поэтому я здесь использую текстовый узел в ComfyUI. В него я подаю референсное изображение, а дальше подключаю языковую модель, которая видит картинку и автоматически собирает нужный формат подсказки.
В моём случае это была Gemma 3. Она смотрит на изображение, распознаёт элементы и пишет и описание референс-листа, и творческое описание будущего видео. Я обычно ставлю максимальную длину 1024, чтобы модель могла выдавать более подробный вариант без обрезки важных деталей. Для такого типа задач это очень удобно, потому что вся структура получается сразу в готовом виде.
Мне нравится ещё и то, что один и тот же текстовый кодировщик можно использовать и для создания подсказки, и внутри самого видеоконвейера. Это сохраняет связность всего процесса. Когда части системы говорят на одном формате, меньше шансов, что результат начнёт расползаться в сторону.
что видно по результату
На выходе хорошо заметно, что оба персонажа сохраняют свои черты довольно стабильно, а камера может двигаться, менять ракурс и приближаться, не теряя саму сцену. Для такой схемы это очень сильный показатель. Пространство не замирает в виде копии референса, а остаётся живым, но при этом продолжает опираться на исходную картинку.
В похожих тестах я всегда смотрю на две вещи: насколько держатся герои и не разваливается ли окружение при смене плана. Здесь результат выглядит уверенно. Мелкие детали, конечно, могут смещаться, но общая визуальная логика не рассыпается. И это как раз тот случай, когда у модели хватает памяти на сцену, а не только на отдельные фрагменты.
Если вам интересно, как именно я собираю такие схемы и какие текстовые приёмы экономят время на практике, у меня в Telegram-канале «AI VISIONS» я как раз показываю похожие рабочие приёмы без лишней теории.
почему не стоит смешивать Ingredients с Prompt Relay
Я отдельно проверяла связку Ingredients с узлом Prompt Relay, который хорошо работал у меня в других схемах, в том числе с MSR Laura. Здесь результат оказался слабым. Первые кадры начинались с самой сетки референса, и это выглядело чужеродно.
Причина простая: у этих двух подходов разные форматы подсказок. Prompt Relay ждёт глобальную подсказку и локальные сегменты, а Ingredients использует свою структуру с описанием референс-листа и блоком целевого действия. Когда вы пытаетесь склеить их между собой, форматы начинают конфликтовать. В видео это сразу видно по стартовым кадрам.
Поэтому сейчас я бы не смешивала Prompt Relay с Ingredients. Если нужен плавный старт без визуального рывка, лучше использовать обычную схему с родным форматом подсказки Ingredients. Тогда персонажи и фон связываются с самого начала и картинка выглядит цельнее.
чем Ingredients отличается от MSR Laura
Если сравнивать Ingredients с MSR Laura от Lykon Studio, обе модели решают похожую задачу — переводят референс в видео. Но у MSR Laura больше свободы в подсказках. Там я спокойно могу использовать стандартный Prompt Relay с глобальными и локальными фрагментами, и персонажи входят в сцену естественно с самого начала.
У Ingredients сейчас есть другое ограничение: он повторно использует всю сетку референса как входной ориентир для каждого кадра. Если видео состоит, например, из 241 кадра, то эта сетка фактически учитывается 241 раз. Поэтому модель держит основу, но работает в своей более жёсткой рамке.
И всё же здесь новый trainer для LTX 2.3 выглядит особенно перспективно. Раз он открыт, теперь можно обучать собственные IC Laura по другому принципу, не повторяя чужую схему один в один. Это уже даёт пространство для эксперимента, и из таких экспериментов обычно вырастают самые интересные результаты.
что меняется, когда у LTX 2.3 появляется свой trainer
В такой работе всегда упираешься в две вещи: сколько ручного контроля у вас остаётся и насколько ровно модель пережёвывает данные. Для оплаты нейросетей я обычно пользуюсь Wanttopay, потому что мне удобнее держать всё через пополняемые виртуальные карты Visa и Mastercard с 3D-Secure и управлять этим из мини-приложения в Телеграме, без лишних пауз посреди рабочего дня. На этом фоне новый trainer для LTX 2.3 мне особенно понятен: он снимает часть технической суеты и даёт больше пространства на сборку результата, а не на бесконечное повторение одних и тех же действий.
Самое заметное здесь — не абстрактное «стало лучше», а то, что у процесса появляется более внятная логика обучения. Когда вы работаете с IC Laura, вам важно не просто запустить тренировку, а удержать последовательность: данные, формат, запуск, проверка. Новый trainer как раз делает этот путь менее рваным. И это чувствуется даже на уровне мелочей, когда меньше сомнений, в какой момент что подать в систему.
что я бы проверяла перед запуском обучения
Я обычно делю подготовку на три спокойных шага, и здесь они особенно уместны. Сначала смотрю на сами данные: подходят ли они под задачу, не слишком ли они разрозненные, есть ли у них одна визуальная логика. Потом проверяю, как оформлен набор для конкретного сценария — видео к видео, аудио к видео или связка аудио плюс видео. И только после этого иду к запуску.
Такая последовательность экономит время лучше любой спешки. Если перепутать порядок, потом сложнее понять, где именно возник сбой: в самом наборе, в формате или уже в тренировке. Для меня это один из главных плюсов обновлённого trainer: он подталкивает к более дисциплинированной работе, а не к хаотичным пробам наугад.
где чаще всего теряется результат
Чаще всего проблемы появляются не в самой идее, а в том, как она оформлена. Если данные собраны слишком пёстро, модель начинает цепляться за случайные детали. Если описание слишком размытое, она хуже держит нужную опору. Если сценарий перегружен лишними элементами, итоговое видео быстро теряет точность.
Я это видела и в своих тестах с видео, и в более спокойных проектах, где нужно было просто удержать характер сцены. Здесь новый trainer для LTX 2.3 полезен тем, что позволяет не прятать проблему за внешней красивостью. Сразу видно, где не хватает порядка.
почему мне нравится идея обучения через агента
Отдельно хочу отметить саму логику инструкций для агента. Мне близок подход, в котором машина выполняет не отдельную команду, а ведёт вас по цепочке. Это особенно удобно, когда проект состоит из повторяемых этапов и утомляет не сложностью, а количеством мелких шагов.
У меня в таких случаях всегда есть одно ощущение: хороший инструмент должен не добавлять шума. Если вы каждый раз вспоминаете, куда нажимать и что за чем идёт, процесс быстро превращается в тяжёлую рутину. А здесь всё выглядит более собранно. Поэтому обновление trainer я воспринимаю как практическое улучшение, а не как очередную техническую новинку ради новинки.
как я бы использовала LTX 2.3 в реальной работе
Если говорить совсем прикладно, то я бы брала LTX 2.3 для задач, где важны устойчивость сцены и повторяемость результата. Это может быть серия коротких видео, где нужно сохранить один и тот же визуальный образ, или более сложная работа, где вы постепенно меняете действие, но не хотите терять персонажа и окружение.
В таких проектах новый trainer ценен ещё и тем, что позволяет меньше отвлекаться на техническую оболочку. Когда всё собрано в более понятный маршрут, у вас остаётся больше сил на саму творческую часть. А для видео это решающий момент, потому что именно там рождается ощущение цельности.
что мне кажется главным в этом обновлении
Главное здесь даже не в том, что появилась новая версия инструмента. Главное в том, что работа с LTX 2.3 стала ближе к нормальному рабочему процессу, где есть структура, понятные этапы и меньше лишней возни. Для тех, кто действительно собирает видео руками и хочет держать контроль над результатом, это очень ощутимый сдвиг.
Я бы смотрела на новый trainer как на способ упростить дорогу к своей модели, а не как на магическую кнопку. Он не делает всё за вас, зато убирает часть барьеров, из-за которых хорошие идеи часто застревают ещё до теста. И это, пожалуй, самое ценное в истории с LTX 2.3.
вывод
Если вам нужен более прямой путь к обучению IC Laura и Laura, новый trainer для LTX 2.3 стоит смотреть очень внимательно. Он лучше организует процесс, помогает держать формат и делает работу с видео менее ломаной. Для меня это тот случай, когда обновление действительно влияет на сам способ работы, а не только на красивую строчку в описании версии.
А ещё приглашаю тебя в мою AI Лабораторию на Boosty — там я регулярно выкладываю уроки по инструментам для работы с видео и изображениями, делюсь промптами, которыми пользуюсь сама, и делаю разборы видео: рассказываю, как создавать с нуля. Подписывайтесь!


