Minimax H3Minimax H3

Продвинутая модель MiniMax для создания видео по тексту, изображениям, видео и аудио. Хорошо подходит для кинематографичных сцен и роликов с персонажами

Стоимость 75Token за секунду видео.  StudyAI может допускать ошибки

1 шагОпишите желаемый результат

Введите промпт с описанием сцены, стиля и дополнительных пожеланий к генерации.

2 шагНастройте генерацию

Добавьте референсы и уточните желаемые настройки генерации.

3 шагПолучите результат

Запустите генерацию и получите готовое видео.

Доступ через StudyAI: тариф и лимиты

StudyAI дает доступ к MiniMax H3 и другим нейросетям без VPN и внутри собственной платформы. Модель доступа — подписка на период, неделю или месяц, с внутренней валютой в виде токенов, которые списываются за генерации.

  • Тарифы начинаются от 199 рублей за 7 дней — тариф LITE дает 400 токенов на баланс.

  • Часть нейросетей доступна без подписки, бесплатно, но с увеличенным временем ответа: такие запросы обрабатываются в общей очереди.

  • В рамках платформы доступна генерация видео длительностью от 4 до 15 секунд.

  • На платформе можно генерировать видео как в базовом разрешении 768p, так и в 2K

MiniMax H3 и Hailuo: видео за минуты с поддержкой LoRA

MiniMax — китайская компания и семейство ИИ-моделей: тексты, музыка, видео. Эта страница — только про видео-направление: модель H3, которая работает под суббрендом Hailuo, и про то, как получить к ней доступ без установки на свое оборудование.

Что такое MiniMax и как Hailuo встраивается в экосистему

MiniMax, или MiniMax AI, разработала компания MiniMax Group Inc. — китайский разработчик искусственного интеллекта, основанный в декабре 2021 года. Нейросеть минимакс объединяет три направления: тексты закрывают модели серии M, включая MiniMax M3, музыку — MiniMax Music, а видео генерирует модель H3 под потребительским суббрендом Hailuo.

Дальше в тексте — только про H3: как нейросеть минимакс в видеоформате превращает текст, изображения и референсы в готовый ролик со звуком, какие у нее ограничения по длительности и разрешению и как получить к ней доступ через платформу, а не напрямую через сайт вендора.

Отличие H3 Turbo: скорость, качество, лимиты

Базовая версия MiniMax H3 — как нейросеть — использует диффузионную генерацию примерно за 20 шагов сэмплирования: модель постепенно убирает шум из случайного видео-тензора, пока не получится итоговый ролик. Turbo-режим сокращает это число до 4–8 шагов за счет применения Turbo LoRA — того же результата модель достигает за меньшее число проходов, жертвуя малой долей детализации в сложных сценах с большим количеством мелких движущихся объектов. Разрешение у обеих версий одинаковое: 768p на выходе, с отдельным шагом апскейла до 2K для роликов, где важна финальная четкость.

Параметр

Базовая H3

H3 Turbo

Шаги сэмплирования

~20

4–8 (Turbo LoRA)

Время генерации

выше

заметно ниже

Базовое разрешение

768p

768p

Апскейл

до 2K отдельным модулем

до 2K отдельным модулем

Когда уместно

финальный рендер, сложная сцена

черновики, быстрый перебор вариантов

Кроме базовой и Turbo, существует вариант H3 Max — с расчетом на более высокое разрешение за счет времени генерации. Логика выбора между вариантами простая: Turbo ускоряет перебор идей на этапе черновика, базовая H3 сохраняет детализацию там, где скорость уже не главный критерий. На практике это означает, что один и тот же промпт стоит сначала прогнать в Turbo, а к базовому режиму возвращаться только для финальной версии ролика.

Применение LoRA для контролируемой генерации

LoRA-адаптер не переобучает саму модель. Он добавляет небольшой набор дообученных весов поверх замороженной сети — базовая MiniMax H3 остается той же, но поведение генерации меняется под конкретную задачу. Для H3 такие адаптеры применяют в трех сценариях:

  • ускорение генерации — Turbo LoRA, о нем ниже;

  • закрепление визуального стиля — от конкретной цветокоррекции до определенного художественного направления кадра;

  • сохранение персонажа между несколькими роликами без повторного описания его внешности в каждом промпте.

Обучение собственного LoRA-адаптера — датасеты, параметры тренировки, конкретные инструменты для тренировки — за рамками этой страницы. Ниже речь только о готовых адаптерах, которые уже можно подключить к MiniMax H3, не собирая их самостоятельно.

Turbo LoRA: ускорение генерации по шагам

Дистилляция базовой модели в Turbo-версию работает так: MiniMax H3 обучают предсказывать результат сразу нескольких шагов диффузии за один проход, жертвуя частью вариативности результата ради скорости. Turbo LoRA распространяется как отдельный файл весов, который подключается поверх базовой модели без переустановки самой нейросети, — это и объясняет разницу в шагах сэмплирования из таблицы выше.

В названиях файлов Turbo LoRA для H3 встречаются обозначения вида v4 или step600: первое — версия адаптера, второе — число шагов диффузии, на которое он рассчитан. Для пользователя платформы это не инструкция по установке в стороннем интерфейсе, а ориентир при выборе: чем новее версия и чем ближе указанное число шагов к диапазону Turbo-режима, тем предсказуемее результат при сопоставимом ускорении.

Текстовое описание → видео: типы сцен и форматы вывода

На входе MiniMax H3 принимает текст, изображения, видео и аудио — конкретное соотношение и число файлов зависят от выбранного режима генерации.

Режимы генерации: FL2VA и Ref2VA

Два режима MiniMax H3 отличаются тем, сколько исходного материала нужно модели и что именно она из него сохраняет на всем протяжении ролика.

  • FL2VA — текст-в-видео либо генерация по одному-двум изображениям, заданным как первый и последний кадр. Подходит, когда сцена описана словами или зафиксированы только опорные кадры начала и конца.

  • Ref2VA — работа с несколькими референсами: до 9 изображений, 3 видео и 3 аудиофайлов, не более 12 файлов суммарно. Модель удерживает персонажа, стиль или характер движения на протяжении всего ролика, а не только в первом кадре — этим Ref2VA в Hailuo отличается от простого перевода одного изображения в видео.

Выбор между FL2VA и Ref2VA — это выбор между быстрым стартом от текстового описания и точным контролем внешности через референсы.

Из чего собрана модель: энкодер, VAE, точности весов

Текстовый и визуальный энкодер MiniMax H3 построен на весах Qwen3-VL-32B — на этом уровне модель распознает описание сцены и содержимое референсных изображений. Диффузионная часть — архитектура Omni-Transformer с 33 миллиардами параметров, а видео и звук проходят через раздельные VAE: один кодирует и декодирует изображение, другой — аудиодорожку. Раздельные VAE для видео и звука — причина того, почему звук получается синхронизированным с картинкой уже на этапе генерации, а не добавляется поверх готового ролика отдельным шагом.

Модель распространяется в нескольких точностях весов — от полной до облегченных: квантование вида INT8, FP8, NVFP4 или GGUF снижает требования к видеопамяти ценой точности вычислений, что может проявляться как потеря мелких деталей или артефакты в движении. Выбор точности — компромисс между тем, на каком оборудовании модель запускается, и тем, сколько деталей сохраняется в результате. Отдельный факт, важный именно для выбора способа доступа: MiniMax H3 распространяется с открытыми весами, что делает ее доступной не только через облачный сервис, но и для запуска на собственном оборудовании — сама установка на этой странице не рассматривается.

Апскейл до 2K

MiniMax H3 генерирует видео в базовом разрешении 768p. Повышение до 2K выполняется отдельным модулем H3-Regenerate-2K уже после основной генерации: на этом шаге восстанавливаются мелкие детали и текстуры, которые в 768p смазаны, — фактура ткани, надписи на заднем плане, черты лица в средних планах. Это вторая, отдельная операция, а не параметр самой генерации: сначала модель собирает ролик в 768p, и только затем при необходимости его пересчитывают в более высоком разрешении.

Форматы вывода и как писать промпт

Ролик MiniMax H3 длится от 4 до 15 секунд при частоте 24 кадра в секунду. Звук выходит в стерео 32 кГц и синхронизирован с видео в момент генерации, а не наложен поверх готового ролика отдельно. Модель поддерживает 11 языков для диалогов и озвучки, включая русский, — реплики персонажей и субтитры можно задавать прямо в промпте, не полагаясь на отдельный перевод.

Диффузионные видео-модели вроде H3 генерируют ролик не кадр за кадром, а шумоподавляют его как единый временной блок — этим объясняется ограничение по общей длительности за один проход: чем длиннее ролик, тем больше этот блок и тем труднее модели удержать согласованность движения и деталей на всей длине.

Три принципа, которые стоит держать в голове при описании сцены для FL2VA или Ref2VA:

  1. описывайте не только первый кадр, а развитие сцены во времени — что меняется к концу ролика: движение камеры, действие персонажа, смена света;

  2. отдельно указывайте звуковую часть — реплику, музыку, окружающий шум, — и если нужен конкретный язык или субтитры, называйте его явно;

  3. учитывайте соотношение сторон под назначение ролика: вертикальный формат для соцсетей требует другой компоновки кадра, чем горизонтальный.

Следи за нами в Telegram и VK

Будь в тренде и учись работать с AI быстрее