LTX Director
LTX Director - це набір кастомних нод для ComfyUI (первинно розроблений автором під ніком WhatDreamsCost, репозиторій WhatDreamsCost-ComfyUI), створений для повноцінного «режисування» та контролю генерації ШІ-відео за допомогою моделі LTX-Video (від Lightricks).
Фактично це вбудований у ComfyUI нелінійний таймлайн-відеоредактор (як Premiere чи DaVinci), який дозволяє створювати довгі, зв'язні, багатокрокові відеосцени замість хаотичних поодиноких 4-секундних кліпів.
Основні можливості та філософія LTX Director
Інтерактивний таймлайн всередині ноди: замість громіздких зв'язок із десятків окремих нод для кожного шоту, всередині інтерфейсу ноди є таймлайн із доріжками для відео, зображень, аудіо та текстових промптів.
Можна розрізати (split), обрізати (trim) та комбінувати фрагменти прямо в UI.
Prompt Relay та часові зони промптів: дозволяє задавати локальні промпти для конкретних секунд хронометражу (наприклад, з 0 по 2 сек. — «людина йде вулицею», з 2 по 4 сек. — «повертає голову і дивиться в камеру»). Модель генерує плавний перехід без видимих артефактів нарізки.
Точний контроль кадрів (First/Last / Anchor Frames): можливість фіксувати початковий і кінцевий кадри (first/last frame pinning), а також задавати проміжні ключові зображення-якорі (anchor frames). Це дає моделі чіткий вектор, від якого стану до якого потрібно дістатися.
Retake Mode (режим перезйомки): якщо на певному відрізку генерації щось пішло не так (наприклад, попливли руки чи обличчя), можна виділити лише цей інтервал і відправити на перегенерацію без необхідності рендерити всю сцену заново.
Робота зі звуком та ліпсінком: підтримка імпорту власного звуку, синхронізація дій/діалогів, а також генерація аудіоінпейнтингу (Audio Inpainting — плавне зведення готового аудіо з тим, що генерує модель).
Підтримка IC-LoRA та Motion-керування: у версіях (LTX Director 2.0+) з'явилася окрема доріжка для IC-LoRA: можна перетягнути референсне відео, і воно спрямовуватиме рух чи композицію генерації.
Збереження проекту: можливість експорту/імпорту таймлайну та всіх його налаштувань разом із медіафайлами у JSON-проєкт для подальшого повернення до роботи.
Версії та сумісність
LTX 2.3 vs LTX 2.5:
Оригінальний пак проектувався здебільшого під модель LTX-Video 2.3.
Існують форки спільноти (наприклад, CGlide/LTX-2.5-Director), адаптовані під версію 2.5. Варто звернути увагу, що деякі специфічні фічі (як-от складні reference-листи під архітектуру 2.3) можуть бути вимкнені у версіях під 2.5 через зміну логіки самої моделі.
ComfyUI-MiniMaxDirector
ComfyUI-MiniMaxDirector від розробника imbutus - це прямий «духовний спадкоємець» концепції LTX Director, адаптований під відеомодель MiniMax H3.
Автор відкрито зазначає в описі репозиторію, що його надихнула робота творця LTX Director (WhatDreamsCost), проте це не копія коду, а нова реалізація під принципово іншу архітектуру моделі.
Чому знадобився окремий «Director» під MiniMax H3?
В LTX-Video: Модель не має складного внутрішнього розуміння сценаріїв, тому LTX Director досягає режисури шляхом прямої ін'єкції ключових кадрів, масок та референсів у латентний простір (latent guiding).
В MiniMax H3: Модель використовує 32B мультимодальний VLM як текстовий енкодер і вміє читати складні структуровані сценарії (перелік шотів, рухи камер, таймінги звуку й діалогів). Але синтаксис промптів для MiniMax настільки строгий і прискіпливий, що одна помилка в розмітці токенів призводить до марнування генерації.
MiniMaxDirector бере на себе роль візуального компілятора: ви збираєте сцену на монтажному таймлайні мишкою, а нода генерує точний, валідний синтаксис розмітки для H3.
Ключові можливості ComfyUI-MiniMaxDirector
Монтажний таймлайн шотів і камер: розбиття на шоти (shots), налаштування рухів камери за офіційною термінологією MiniMax (тип руху × амплітуда × швидкість), таймінги екранного тексту.
Вкладка персонажів (Cast / WHO & WHAT): спеціальний менеджер сутностей: кожна картка персонажа пов'язує референсне обличчя, голос, силу збереження референсу (reference strength) та режим Face Swap (накладання зовнішності на іншого персонажа).
Синхронізація діалогів та звуку: оскільки MiniMax H3 генерує відео та стереозвук/голоси в один прохід, на таймлайні можна розставляти аудіо-маркери, закадровий голос (VO) та репліки персонажів із тегами <d>, навіть якщо фраза перетинає монтажну склейку між шотами.
Автоматична прив'язка до сітки кадрів (Frame Lattice Snapping): МініМакс має суворе математичне правило для кількості кадрів (довжина кліпу обов'язково має відповідати формулі length % 17 == 5, тобто 5, 22, 39, 56, 73, 90, 107, 124 кадри тощо). Редактор автоматично «примагнічує» тривалість шотів до дозволених значень, щоб генерація не падала з помилкою.
Інтерактивні панелі контролю (Prompt & Report): MiniMaxDirectorPrompt — показує скомпільований текст промпту на льоту в процесі редагування таймлайну (не потрібно запускати чергу генерації, щоб побачити фінальний промпт).
MiniMaxDirectorReport — вбудований «лінтер», який перевіряє ваш сценарій на помилки та попереджає про порушення правил промптингу MiniMax.
Робота з двома VAE: враховує архітектуру H3, де за відео і звук відповідають різні VAE, та коректно комутує латенти для семплера.
Підсумок
Якщо LTX Director створювався для контролю латентів та ключових кадрів у локальній легкій моделі LTX, то MiniMaxDirector - це повноцінний режисерський мікшер для важкої мультимодальної моделі MiniMax H3, що рятує від необхідності писати довгі кілометри коду та промптів вручну.
То що ж вибрати?
Для зрілого ComfyUI-спеціаліста вибір між LTX Director та MiniMaxDirector зводиться не до «який інтерфейс зручніший» (вони візуально схожі за концепцією), а до фундаментальної різниці в рівні втручання в пайплайн (Latent-level проти Semantic-level) та цілей фінального продакшену.
Нижче наведено технічне порівняння архітектури, механізмів контролю та конкретних сценаріїв використання.
1. Архітектурна різниця: як саме ноди керують генерацією
Різниця між цими нодами лежить у фундаментальному підході: LTX Director є низькорівневим контролером латентного простору, тоді як MiniMaxDirector є високорівневим семантичним компілятором синтаксису для важкої мультимодальної моделі.
1) Механізм впливу на генерацію (Latent Guiding проти Semantic Compilation)
LTX Director:
Працює всередині дифузійного графа на рівні прямого втручання в латенти та шум. Нода функціонує через фізичну ін'єкцію кадрів у часову шкалу латентного тензора: вона бере початковий, кінцевий або проміжний якірний кадр (anchor frame), кодує його через VAE, розтягує/маскує масив шуму в семплері та призначає індивідуальні ваги денойзу (denoise strengths) для окремих зон таймлайну. Текстовий промпт тут є вторинним фактором напрямку, а сам каркас сцени тримається на жорсткому латентному зв'язуванні.
MiniMaxDirector:
Не втручається в окремі кадри латентного простору напряму. Замість цього нода слугує візуальним транслятором: вона перетворює блоки на монтажному столі (шоти, зміни ракурсів, таймінги) на суворий синтаксичний код розмітки, який згодовується мовній моделі енкодера. Режисура відбувається за рахунок того, що внутрішні механізми моделі зчитують згенерований нодою скрипт і самі планують геометрію та динаміку сцени.
2) Природа бекенду та текстових енкодерів (DiT + T5/CLIP проти 32B VLM)
LTX Director (модель LTX-Video):
Побудований навколо компактного Diffusion Transformer (DiT) у парі зі стандартними енкодерами на зразок T5 або CLIP. Сама модель має обмежену «ємність знань про світ» і практично не здатна зрозуміти комплексний наративний сценарій (наприклад, зміну ракурсів чи причинно-наслідкові дії) суто з тексту. Тому єдиний спосіб її контролювати — це зовнішні обмежувачі (маски, референсні латенти, IC-LoRA).
MiniMaxDirector (модель MiniMax H3):
Спирається на повноцінну 32-мільярдну мультимодальну модель (VLM) як текстовий енкодер. Завдяки цьому бекенд має глибоке семантичне розуміння кінематографічної теорії, анатомії, взаємодії об'єктів та темпоральної логіки. Він нативно інтерпретує такі параметри, як амплітуда панорамування, тип об'єктива чи зміна планів між персонажами, без необхідності підсовувати йому ControlNet або маски.
3) Пайплайн обробки аудіо (External / Secondary проти Native Dual-Stream)
LTX Director:
Робота з аудіо є зовнішньою. Модель LTX-Video генерує виключно візуальні латенти (пікселі). Нода LTX Director дозволяє розмістити аудіодоріжку на таймлайні лише як референс для таймінгу або підготувати дані для сторонніх audio-inpainting нод. Будь-який ліпсінк чи генерація діалогів потребує додавання у воркфлоу окремих інструментів (TTS, Wav2Lip, LivePortrait тощо).
MiniMaxDirector:
Працює з нативною аудіовізуальною архітектурою. У MiniMax H3 реалізовано паралельну генерацію: у графу використовуються два окремих VAE — один для відеоряду, другий для аудіо. Семплер дифундує зображення і звук синхронно в єдиному циклі. Нода транслює репліки з таймлайну через спеціальні службові токени (зокрема <d>), дозволяючи отримати персонажа, який говорить своїм тембром із точним ліпсінком та навколишніми шумами (Foley) без жодних сторонніх утиліт.
4) Темпоральна дискретизація та кадрова математика (Frame Lattice)
LTX Director:
Використовує відносно гнучкий крок дискретизації, типовий для стандартних DiT. Довжина кліпу підпорядковується звичайному коефіцієнту просторово-часового стиснення VAE (зазвичай кратна 8 або 16). Можна виставити практично будь-яку довільну кількість кадрів (49, 65, 97, 129), і пайплайн без проблем відпрацює семплінг.
MiniMaxDirector:
Підпорядковується жорсткому математичному обмеженню архітектури MiniMax H3: кількість кадрів у будь-якому блоці повинна суворо відповідати формулі length % 17 == 5 (допустимі дискретні значення: 5, 22, 39, 56, 73, 90, 107, 124 кадри тощо при 24 fps). Нода бере на себе функцію автоматичного «примагнічування» (Lattice Snapping) будь-якого розрізу на таймлайні до найближчого валідного значення, запобігаючи крешу семплера через невідповідність розмірностей тензорів.
5) Апаратні ресурси, VRAM та ітеративність (Rapid Prototyping проти Heavy Compute)
LTX Director:
Максимально адаптований під локальний продакшен. Навіть у повній точності або легкому FP8 він споживає від 12 до 24 GB VRAM і працює на одній відеокарті споживчого класу (RTX 3090 / 4090). Швидкість семплування дозволяє проганяти драфти за 30–90 секунд, що забезпечує швидкий зворотний зв'язок при пошуку вдалого руху камери.
MiniMaxDirector:
Екстремально вимогливий до обчислювальних ресурсів. Поєднання 32B VLM, масивного DiT-бекенду та подвійного декодера VAE навіть за умови квантування (FP8 / GGUF) впирається в стелю пам'яті споживчих відеокарт і вимагає постійного оффлоаду в системну RAM або розгортання на серверних картах (A100 / H100 80GB). Ітерація триває значно довше, тому нода спроєктована так, щоб мінімізувати помилки в скрипті ще до запуску черги генерації (вбудований лінтер і попередній перегляд промпту).
2. Глибина контролю (Determinism vs Semantics)
LTX Director — це хірургічний скальпель над пікселями/латентами:
Якщо вам потрібен строгий перехід між референсами: Кадр А (початок) Кадр Б (кінець) із фіксацією проміжних якорів (anchor frames).
Підтримка IC-LoRA: ви можете скормити вектор руху через зовнішнє відео та спрямувати траєкторію.
Retake Mode через маскування денойзу: можна буквально виділити часовий сегмент або просторову зону, задати denoise = 0.65 і перегенерувати лише шматок руху руки/голови, зберігши оточення.
MiniMaxDirector — це пульт віртуального режисера на знімальному майданчику:
Тут ви не контролюєте окремі латентні латки вручну. Ви оперуєте мовою кіновиробництва: тип руху камери (Pan/Tilt/Dolly), його амплітуда і швидкість.
Керування акторським складом (Cast Tab): ви прив'язуєте референс персонажа, його тембр і даєте йому репліку через токен <d>. Модель сама зіграє міміку, відкриє рот у потрібний момент і згенерує синхронний голос разом із фоновим інтершумом.
Монтажні склейки всередині одного проходу (Multi-shot generation): ви описуєте кілька шотів поспіль, і модель самостійно відпрацьовує перемикання планів.
3. Матриця вибору: в якому випадку що обрати
Обирайте LTX Director, коли:
Продуктовий або VFX-пайплайн (Product Placement / Motion Design):
Потрібно інтегрувати 3D-рендер або конкретний статичний об'єкт у початковий/кінцевий кадр без деформації його геометрії.
Швидке локальне прототипування (High-speed Iteration):
Вам потрібно генерувати десятки варіантів руху за хвилини на локальній машині для превізуалізації або геймдеву.
Робота з тонким контролем (LoRA / ControlNet-пакети):
Ви тренуєте власні LoRA на специфічний стиль або використовуєте IC-LoRA для точного відтворення рухів камери з превізів (Blender/Maya).
Покадровий ретуш (Inpainting / Outpainting):
Завдання вимагає виправлення дефектів на готовому матеріалі без перегенерації всього кліпу з нуля.
Обирайте MiniMaxDirector, коли:
Наративне кіно, сторітелінг, діалогові сцени:
Сцена, де два персонажі говорять, змінюються плани (shot-reverse-shot), є ембієнтний звук кроків чи вулиці. Робити це в LTX вимагало б 4–5 окремих нейромереж (генерація + TTS + LivePortrait/Wav2Lip + Foley + монтаж), тоді як MiniMax H3 видає це з коробки в один прохід.
Складні кінематографічні рухи камер без LoRA:
Коли потрібно реалізувати зв'язку на зразок "Fast Whip Pan Left Medium Static Shot Slow Push-in", опираючись на внутрішнє розуміння VLM, а не натреновані траєкторії.
Face Consistency без перенавчання (Zero-shot Actor Pipeline):
Завдяки механізму Cast/Face-Swap у MiniMax H3 можна підтримувати єдність персонажа крізь шоти значно стабільніше за рахунок великої мовної моделі та крос-атеншену, ніж через прості IP-Adapter рішення в LTX.
Резюме для GenAI-інженера
Використовуйте LTX Director як Motion Compositor: коли проект вимагає точної геометрії, роботи з ключовими кадрами, низької вартості секунди рендеру та контролю над денойзом у латентах.
Використовуйте MiniMaxDirector як Screenplay Generator: коли вам потрібен завершений кінематографічний аудіовізуальний фрагмент (з репліками, акторами та операторською роботою), де ціна генерації вища, але пайплайн скорочується з 6 етапів до одного скомпільованого промпту.



No comments:
Post a Comment
А что вы думаете по этому поводу?