MiniMax H3 Max 실행하기
이 모델로 고정된 생성기입니다. 480P 또는 768P, 5~15초, 오디오 포함입니다. 프롬프트를 다듬는 동안에는 480P로 초안을 만드는 것이 좋습니다. 이 모델의 가격 이점이 실제로 드러나는 해상도가 480P이기 때문입니다.
영상 생성 설정
모델
0/7000
영상 해상도
길이
영상 화면 비율
오디오 생성
AI가 영상에 어울리는 오디오를 함께 생성합니다.
영상 미리보기
영상을 클릭하면 전체 화면으로 볼 수 있습니다 • 스와이프하거나 화살표로 더 보기
MiniMax H3 Max 기능 가이드
이 모델이 받는 입력과 내놓는 출력입니다. 여기 적힌 내용은 모두 이 페이지의 설정이 아니라 모델 자체의 고정된 제한입니다.
출력
- 480P 또는 768P — 요금과 관계없이 2K는 없음
- 5~15초 — 최소 길이는 4초가 아니라 5초
- 16:9 설정에서 1344×768 해상도, 24fps
- 모든 생성에 동기화된 오디오 포함, 끄는 옵션 없음
입력
- 텍스트 → 영상은 화면 비율 6가지를 모두 지원: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
- 이미지 → 영상은 첫 프레임을 받고, 마지막 프레임은 선택 사항
- 이미지 → 영상은 입력한 이미지의 화면 비율을 그대로 따름 — 업로드 전에 미리 자르기
- 공개된 프롬프트 길이 제한 없음 — 아주 긴 지시문은 검증되지 않은 영역으로 볼 것
지원 조합
- 텍스트만
- 텍스트 + 첫 프레임
- 텍스트 + 첫 프레임 + 마지막 프레임
위 생성기는 크레딧을 차감하기 전에 모든 조합의 비용을 먼저 보여 줍니다.
MiniMax H3 Max 주요 기능
아래 클립은 모두 기본 해상도인 1344×768로 생성한 모델 결과물이며, 클립마다 자체 오디오 트랙이 있습니다.
한 샷 안의 캐릭터 일관성
카메라가 따라가는 동안에도 스타일화된 캐릭터가 같은 얼굴, 헤어, 의상을 유지합니다. 이런 샷에서 흔한 실패는 첫 1초와 마지막 1초 사이에 모습이 달라지는 것이며, 이미지 → 영상 리더보드가 측정하는 것도 바로 이 부분입니다.
첫 프레임과 마지막 프레임
샷의 시작과 끝을 고정하면 모델이 그 사이를 채웁니다. 부풀어 오르거나 열리거나 조립되는 것처럼 시작과 끝 상태가 분명한 물리적 과정이라면, 움직임을 말로 설명하기보다 양 끝을 고정하는 편이 낫습니다.
한 번에 함께 생성되는 오디오
생성할 때마다 룸톤, 폴리, 환경음, 음악까지 동기화된 사운드가 함께 나옵니다. 나중에 음악을 따로 입혀야 하는 무음 클립이 아닙니다. 플레이어의 음소거를 해제하면 들을 수 있습니다. 켜고 끄는 옵션도, 별도의 오디오 작업도 없습니다.
흔들리지 않는 아트 디렉션
광고처럼 보이는 영상도 클립 중간에 룩이 오락가락하지 않고 처음부터 끝까지 하나의 조명과 그레이딩을 유지합니다. 따로 생성한 여러 샷을 한데 편집할 수 있을지는 바로 이 특성이 좌우합니다.
화면 속 텍스트 렌더링
짧은 화면 텍스트는 깔끔하고 자간도 정확하게 나올 수 있는데, 영상 모델로서는 드문 일입니다. 다만 몇 단어 이내로 제한하는 것이 좋습니다. 어디서부터 무너지는지는 다음 섹션에서 보여 줍니다.
텍스트 렌더링이 무너지는 지점
앞 클립에서 깔끔한 글자를 만들어 낸 바로 그 기능이 여기서는 “the takes hells war”를 만들어 냅니다. 단어 모양은 대충 맞지만 문장이 되지 않게 늘어놓은 결과입니다. 문자열이 길거나, 세리프 서체이거나, 여러 줄로 배치하면 모두 이렇게 되기 쉽습니다. 화면 속 텍스트는 많아야 두어 단어로 생각하고, 텍스트에 의존하는 클립은 내보내기 전에 모든 프레임을 직접 읽어 확인해야 합니다.
MiniMax H3 Max 예시
| MiniMax H3 Max | MiniMax H3 | |
|---|---|---|
| 계보 | H3 오픈 가중치를 사후 학습 | MiniMax |
| 길이 | 5~15초 | 4~15초 |
| 최대 해상도 | 768P | 2K |
| 최저 해상도 | 480P | 768P |
| 768P 5초 클립 실제 생성 시간 | 3초 미만 | 약 90~120초 |
| 네이티브 오디오 | 있음 (동기화) | 있음 (2채널 스테레오) |
| 화면 비율 | 텍스트 → 영상은 6가지, 이미지 → 영상은 입력 이미지 비율을 따름 | 텍스트 → 영상은 6가지, 이미지 → 영상은 입력 이미지 비율을 따름 |
| 참조 입력 | 첫 프레임과 마지막 프레임, 며칠 뒤 참조 이미지로 영상 추가 | 최대 12개 파일: 이미지 9개 + 영상 3개 + 오디오 3개 |
| 프롬프트 길이 | 미공개 | 약 7,000자 |
| Design Arena i2v Elo 점수 | 1,341 | 1,333 |
| 연속 모드 | Director, 최대 2분 | 없음 |
20번 시도할 때 모델별로 드는 비용과 시간까지 담은 전체 비교는 H3 Max vs MiniMax H3에서 볼 수 있습니다. 2K로 납품해야 한다면 MiniMax H3 원본 모델이 필요합니다.
설정과 조정 요령
prompt_expansion_modebalanced | qualitybalanced는 약 1초, quality는 약 30초의 오버헤드를 더합니다. 30초면 렌더링 시간의 10배입니다. 조정은 balanced로 하고, 최종으로 남길 테이크에서만 quality로 바꾸는 것이 좋습니다. quality로 계속 두면 애초에 이 모델을 쓰는 이유가 사라집니다.
resolution480P | 768P2K는 없습니다. 480P는 초안용 해상도이자 가장 저렴하게 반복할 수 있는 방법이며, 768P는 클립당 크레딧이 약 1.5배 듭니다. 480P에서 샷을 찾고 768P에서 확정하는 순서가 좋습니다.
aspect_ratio21:9, 16:9, 4:3, 1:1, 3:4, 9:16두 모델 모두 텍스트 → 영상에서만 쓸 수 있습니다. 이미지 → 영상에는 두 모델 모두 이 매개변수가 없고 입력 이미지의 비율을 따르므로, 세로 영상을 원하면 첫 프레임도 세로여야 합니다.
duration5-15s, default 5최소 길이는 5초입니다. 더 짧은 장면이 필요하면 5초로 생성한 뒤 잘라내야 합니다. 15초 상한은 어떤 방법으로도 늘릴 수 없으므로, 더 긴 영상은 여전히 이어 붙여야 합니다.
end_image_urlimage-to-video only샷이 끝나는 지점을 고정합니다. image_url 매개변수와 함께 쓰면 움직임을 말로 설명하고 결과를 운에 맡기는 대신, 그 움직임의 양 끝을 확실히 고정할 수 있습니다.
한 번에 한 구문만 바꾸기
느린 모델에서는 한 번 돌리는 비용이 커서 프롬프트에 처음부터 모든 것을 담게 됩니다. 여기서는 반대로 하는 편이 이득입니다. 구문 하나를 바꾸고, 결과를 보고, 다음 구문을 바꿉니다. 두 가지를 한꺼번에 바꿨는데 샷이 좋아졌다면, 어느 쪽이 효과를 냈는지는 전혀 알 수 없습니다.
카메라보다 피사체 먼저 고정하기
카메라 언어는 영상 프롬프트에서 가장 변동이 큰 부분으로, 건드리는 순간 구도와 프레이밍, 템포가 한꺼번에 새로 정해집니다. 피사체와 배경을 먼저 안정시킨 다음 무빙을 넣는 것이 좋습니다.
480P로 초안, 768P로 확정
두 해상도는 세부 묘사가 늘 일치하지는 않으므로, 480P에서 잘 나온 프롬프트는 완성본이 아니라 후보일 뿐입니다. 최종으로 남길 샷마다 768P 확인용 생성을 한 번씩 예산에 넣고, 높은 해상도에서 얼굴과 화면 속 텍스트를 다시 확인해야 합니다.
비교할 때는 시드 고정
아직 샷을 찾는 단계라면 무작위 시드가 공짜로 다양성을 줍니다. 하지만 두 가지 표현을 비교하기 시작했다면 시드를 고정해야 눈에 보이는 차이가 운이 아니라 프롬프트에서 비롯된 것임을 알 수 있습니다.
프롬프트 구조는 원본 모델과 같습니다. 이 사이트의 H3 프롬프트 가이드에서 두 모델이 공통으로 받는 형식을 설명하고, 첫·마지막 프레임 빌더가 키프레임 형식을 작성해 주며, 카메라 제어 참고표에 H3가 인식하는 무빙 20가지가 모두 정리되어 있습니다.
MiniMax H3 Max 사용법
- 01장면 말고 샷 단위로 쓰기피사체 하나, 동작 하나, 카메라 무빙 하나. 모델은 최대 15초까지만 생성하므로, 세 가지 일이 연달아 일어나는 지시문은 제대로 찍히는 대신 압축되어 버립니다.
- 02480P로 초안 만들기프롬프트를 다듬는 동안에는 저렴한 해상도로 생성합니다. 한 번에 약 3초이므로, 예전에 느린 생성 한 번을 기다리던 시간에 열 가지 표현을 시험해 볼 수 있습니다.
- 03한 번에 한 구문씩 바꾸기생성할 때마다 요소 하나만 조정해야 어떤 변경이 효과를 냈는지 알 수 있습니다. 반복이 빠르면 보상받고 반복이 느리면 손해 보는 방식입니다.
- 04남길 샷은 768P로 확정가장 잘 나온 프롬프트를 높은 해상도로 다시 생성하고, 최종본으로 삼기 전에 얼굴과 손, 화면 속 텍스트를 확인합니다.
비용을 날리는 실수
반복 작업 중에 프롬프트 확장을 quality로 두는 것
3초짜리 반복이 30초짜리가 됩니다. 속도 이점을 통째로 잃는 가장 빠른 길입니다.
768P로 반복 생성하는 것
다시 생성할 때마다 같은 샷을 480P로 만들 때보다 크레딧이 약 1.5배 듭니다. 초안은 낮은 해상도로, 확정은 높은 해상도로.
Director를 클립 엔드포인트처럼 다루는 것
실제로 시청된 초 수가 아니라 최소 길이가 정해진 세션 전체를 기준으로 과금됩니다. Director를 전제로 설계하기 전에 분 단위로 예산을 잡아야 합니다.
가로 이미지를 올리고 세로 영상을 기대하는 것
이미지 → 영상은 입력 이미지의 화면 비율을 그대로 따릅니다. 먼저 잘라 두지 않으면 생성 한 번이 통째로 낭비됩니다.
화면 속 텍스트를 읽어 보지 않고 클립을 내보내는 것
텍스트 렌더링은 두어 단어만 넘어가도 급격히 무너지고, 깨진 문장은 누군가 읽기 전까지는 눈에 띄지 않습니다.
2K 납품을 전제로 기획하는 것
요금과 관계없이 2K는 제공되지 않습니다. 샷이 승인된 뒤에야 이를 알게 되면 다른 곳에서 다시 렌더링해야 합니다.
MiniMax H3 Max 자주 묻는 질문
- MiniMax H3 Max란 무엇인가요?
- MiniMax H3의 오픈 가중치를 사후 학습해 2026년 9월 1일에 출시한 영상 모델입니다. 동기화된 오디오가 포함된 5초 768P 클립을 3초 안에 렌더링합니다. 이름의 “Max”는 라인업에서 더 큰 모델이라는 뜻이 아니며, 오히려 2K를 포기하고 속도를 얻은 모델입니다.
- MiniMax H3 Max와 MiniMax H3는 어떻게 다른가요?
- 속도와 해상도입니다. 같은 클립을 훨씬 빨리 만들어 내지만, MiniMax H3가 2K까지 지원하는 데 비해 최대 768P에 그칩니다. H3 Max의 480P는 이 사이트에서 가장 저렴하게 반복 생성하는 방법이며, 2K 작업은 여전히 MiniMax H3로 해야 합니다.
- MiniMax H3 Max는 어떤 해상도와 길이를 지원하나요?
- 480P 또는 768P, 5~15초이며 모든 생성에 동기화된 오디오가 포함됩니다. 16:9·768P로 생성하면 1344x768 해상도에 24fps로 출력됩니다. 2K 옵션은 없습니다.
- 이 사이트에서 MiniMax H3 Max를 쓰려면 비용이 얼마나 드나요?
- 크레딧으로 계산되며, 생성기는 실제로 차감하기 전에 모든 조합의 비용을 미리 보여 줍니다. 버튼에 선택한 해상도와 길이에 맞는 정확한 비용이 표시됩니다. 5초 480P 클립이 이 페이지에서 가장 저렴하고, 길이가 길어지거나 768P를 고르면 그만큼 비용이 올라갑니다.
- 여기서 MiniMax H3 Max로 바로 생성할 수 있나요?
- 네. 이 페이지의 생성기는 MiniMax H3 Max로 고정되어 있으며, 새 계정은 가입할 때 무료 크레딧을 받습니다. 모델이 내 프롬프트를 어떻게 처리하는지 가장 저렴하게 확인하는 방법은 5초 480P 클립입니다.
- MiniMax H3 Max에는 어떤 엔드포인트가 있나요?
- 텍스트 → 영상과 이미지 → 영상이 먼저 나왔고, 며칠 뒤 참조 이미지로 영상이 추가되었습니다. Director는 연속 모드로, 파일을 돌려주는 대신 스트리밍 세션 내내 맥락을 이어 갑니다.
- MiniMax H3 Max Director란 무엇인가요?
- 연속 생성 버전입니다. 영상 스트림 하나를 계속 열어 둔 채 전체에 걸쳐 맥락을 유지하므로, 스트리밍 도중에 보낸 프롬프트가 연속성을 깨지 않고 동작을 바꿉니다. 세션은 기본적으로 최대 2분이며, 요금은 클립이 아니라 세션 단위로 계산됩니다.
- MiniMax H3 Max가 정말 1위인가요?
- 두 리더보드에서 근소한 차이로 1위입니다. Design Arena의 이미지 → 영상 부문에서 1,341 Elo로 1위이고, MiniMax H3가 1,333으로 바로 뒤를 잇습니다. Artificial Analysis에서는 샘플 2,177개를 기준으로 오디오 포함 이미지 → 영상 부문에서 1,201 Elo로 1위입니다. 원본 모델보다 8 Elo 앞선 것은 우위일 뿐 큰 격차는 아니며, 진짜 핵심은 속도입니다.
- MiniMax H3 Max로 가장 좋은 결과를 얻으려면 어떻게 설정해야 하나요?
- 반복 작업 중에는 prompt_expansion_mode 값을 balanced로 두는 것이 좋습니다. quality는 생성할 때마다 약 30초가 더 걸리기 때문입니다. 초안은 480P로 만들고, 남길 샷은 768P로 확정합니다. 이미지 → 영상에서는 출력이 첫 프레임의 화면 비율을 그대로 따르므로, 첫 프레임을 원하는 비율로 미리 잘라 두어야 합니다.
- MiniMax H3 Max는 화면 속 텍스트를 렌더링할 수 있나요?
- 경우에 따라 가능합니다. 짧은 단어 두어 개는 깔끔하게 나올 수 있지만, 문자열이 길어지면 글자 모양만 흉내 낸 무의미한 문자로 무너집니다. 이 페이지에 바로 그런 예시가 있습니다. 텍스트가 의미를 전달하는 클립이라면 내보내기 전에 모든 프레임을 직접 읽어 확인해야 합니다.
이 사이트는 MiniMax와 제휴 관계가 없는 독립적인 제3자 도구입니다.