Омни-модальная модель: текст, изображения, видео и аудио попадают в один контекст, а на выходе — 4-15 секунд в нативном 2K, где картинка и стерео-звук рождаются вместе. Реплики озвучиваются с lip-sync, а загруженное видео можно переделать или продолжить обычной текстовой инструкцией.
2K — родное разрешение модели, а не апскейл после генерации: кадр собирается сразу в нём, поэтому мелкая фактура (ткань, волосы, надписи на предметах) не размывается.
До 9 изображений, 3 видеоклипов и 3 аудиодорожек в одном запросе. Каждому референсу назначается своя роль: лицо героя с одного фото, куртка с другого, ритм монтажа из видео.
Реплики с lip-sync, шаги, дождь, эмбиенс и музыка генерируются вместе с картинкой, а не подкладываются потом. Отключить звук нельзя — поэтому его стоит описать в промпте.
Загруженное видео можно переделать или продолжить текстовой инструкцией — заменить фон, сменить стиль, дорисовать продолжение сцены. По независимым замерам это сильнейшая сторона модели.
Текст в видео; первый и/или последний кадр; омни-референс из фото, видео и аудио. Кадры и референсы — разные режимы и не совмещаются в одном запросе.
Аудиофайл задаёт тембр и подачу конкретного персонажа: модель говорит вашим голосом. Аудио-референс работает только вместе с изображением или видео.
Стоимость = ставка за секунду × длительность ролика. Если загружены видео-референсы, их длительность прибавляется к длительности выхода и тарифицируется по той же ставке.
Первые пять входных изображений входят в цену. Шестое и далее оплачиваются отдельно — при максимуме в 9 картинок доплата не превышает четырёх изображений.
Диапазон: от — кредитов за 4 секунды в 768P до — кредитов за 15 секунд в 2K.
Опишите звук. Тишины по умолчанию не бывает: если про звук в промпте ничего нет, модель придумает случайный эмбиенс. Отдельно скажите про фон, шаги, голоса и закадровую музыку.
Пишите реплики дословно и на нужном языке — модель озвучит их с lip-sync ровно так, как написано. Короткая фраза на 5 секунд, не абзац.
Разбейте длинный ролик на шоты. Для 7-15 секунд задайте 2-5 планов с отметками склейки; один план — 2-5 секунд, короче полутора секунд шот не читается.
Одно движение камеры на шот и всегда с амплитудой и скоростью: «медленно, с малой амплитудой Push In». Комбинация нескольких движений в одном плане даёт дёрганый результат.
Каждому референсу — одна роль, без пересечений: «с первого фото берём лицо и причёску, фон оттуда не берём». Негативного промпта у модели нет — формулируйте позитивно.
Это одна и та же модель: MiniMax H3 — официальное название, Hailuo 3.0 — как её называют в приложении Hailuo.
Нет, звук генерируется всегда и в том же проходе, что и картинка — отключить его в запросе нельзя. Если звук не нужен, отключите его уже при монтаже или выберите модель без обязательного аудио.
У H3 2K — родное разрешение: кадр сразу собирается в нём, а не увеличивается после генерации. По цене это уровень 1080p у WAN 2.7, то есть заметно дешевле остальных флагманов.
До 9 изображений, до 3 видео (2-15 секунд каждое, не больше 15 секунд суммарно) и до 3 аудиодорожек. Аудио работает только вместе с изображением или видео.
Это два разных режима модели. Кадры (первый и последний) задают начало и конец одного непрерывного плана, а референсы задают внешность, стиль и звук. Выберите что-то одно.
Длительность входных видео прибавляется к длительности ролика и считается по ставке выбранного разрешения. Первые пять изображений бесплатны, шестое и далее — по фиксированной цене за штуку. Входное аудио бесплатно.
Пишите на своём языке — AI-улучшение соберёт промпт в официальном формате MiniMax, а отдельной кнопкой его можно перевести на английский. Реплики персонажей при переводе остаются на исходном языке.
Нативные 2K со звуком и lip-sync в одном проходе — от — кредитов за ролик.
Мы используем cookies для работы сервиса, сохранения сеанса и обезличенной статистики. Подробнее в Политике конфиденциальности.