마지막 프레임에 끝내 닿지 않는다
원인: 프롬프트가 두 장의 정지 이미지를 설명했을 뿐 그 사이 경로를 쓰지 않아, 모델에게 수렴할 이유가 없었습니다.
해결: 중간을 쓰세요. 피사체가 지나가는 상태들을 적고, 마지막 숏이 끝날 때 Picture 2의 구도와 일치할 때까지 차이가 좁혀진다고 서술하세요.
두 장의 이미지는 H3도 이미 보고 있습니다. 보지 못하는 건 그 사이를 어떻게 지나가는지이고, FL2VA 프롬프트가 쓸 내용은 그것뿐입니다. 변화를 설명하면 MiniMax가 모델과 함께 배포한 형식 그대로 정렬 문장, 숏 타임라인, 사운드스케이프, 음악까지 조립해 줍니다.
프롬프트 만들기
프리셋에서 시작해도 되고 직접 써도 됩니다. 오른쪽은 실시간으로 조립되며, 손으로 쓸 때 가장 많이 틀리는 정렬 문장도 포함되어 있습니다.
FL2VA 프롬프트
MiniMax 공식 형식 — 정렬 문장 다음에 세 개의 필드.
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 6.00-second mark of the target video. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a matte black gift box sits closed and centred on a pale marble counter under soft window light, its lid seam facing camera, matching the position, framing, and lighting established by Picture 1. The camera pushes in with small amplitude at slow speed as two hands enter from the lower edge, lift the lid straight up and set it aside, then withdraw as the tissue paper falls open around a glass serum bottle. Toward the end of the shot the differences narrow until the serum bottle stands upright and unobstructed in the centre of the counter with the opened box behind it and the dropper cap facing camera, landing on the exact pose, spacing, and composition established by Picture 2 at the 6.00-second mark. overall_soundscape: A quiet room tone carries throughout, broken by the soft friction of the lid sliding free, the rustle of tissue paper, and the light tap of glass settling on stone. non_diegetic_music: Sparse marimba notes at a slow tempo, joined by a warm synth pad that swells once as the bottle is revealed.호스팅 MiniMax H3에서 실행
이 프롬프트가 채워지고 Image to Video 탭이 선택된 상태로 생성기가 열립니다. 시작 프레임과 끝 프레임은 거기서 첨부하세요.
프롬프트 점검
지적할 부분이 없습니다. 두 프레임이 모두 서술됐고, 중간에 경로가 있으며, 하나의 연속된 숏입니다.
구조
네 부분이 정해진 순서로 놓입니다. 정렬 문장을 빼면 H3는 어느 쪽이 시작이고 어느 쪽이 결말인지 알 수 없습니다.
Picture 1을 0.00초에, Picture 2를 영상 끝에 고정하는 한 문장입니다. 종료 시각은 소수점 아래 정확히 두 자리이고, 그다음 한 줄을 비운 뒤 필드가 시작됩니다.
본문입니다. 스타일, 시작 구도, 두 프레임 사이의 움직임 경로, 카메라 워크, 화자, 대사, 화면에서 나는 모든 소리. FL2VA의 성패가 여기서 갈립니다.
영상 전체의 환경음, 동작음, 말이 아닌 사람 소리를 1~4문장으로 정리합니다. 대사, 노래, 인물이 들을 수 있는 음악은 본문 몫이라 여기 쓰지 않습니다.
인물은 듣지 못하는 음악을 1~3문장으로 씁니다. 악기, 템포, 리듬, 강약. 없으면 N/A이고, 이는 회피가 아니라 정식 답변입니다.
MiniMax 공식 FL2VA 예시
H3 가중치와 함께 배포된 프롬프트 작성 가이드의 8초 단일 숏 예시이며, 분량 때문에 일부를 줄였습니다. 본문이 두 이미지를 설명하지 않고, 그 사이에서 우산이 펴지는 과정을 쓰고 있다는 점을 보세요.
How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot 1) aligns with the 8.00-second mark of the target video. integrated_multimodal_description: [Shot 1] Live-action, cinematic, a rain-soaked cyclist begins in the position and framing established by Picture 1 … overall_soundscape: Rain falls steadily on the pavement, followed by the metallic click of the umbrella runner … non_diegetic_music: N/AHugging Face에서 전체 가이드 보기
어긋나는 지점
실패한 첫·마지막 프레임 영상은 거의 이 중 하나입니다. 여섯 중 다섯은 모델이 아니라 프롬프트 문제입니다.
원인: 프롬프트가 두 장의 정지 이미지를 설명했을 뿐 그 사이 경로를 쓰지 않아, 모델에게 수렴할 이유가 없었습니다.
해결: 중간을 쓰세요. 피사체가 지나가는 상태들을 적고, 마지막 숏이 끝날 때 Picture 2의 구도와 일치할 때까지 차이가 좁혀진다고 서술하세요.
원인: 어떤 속성이 고정인지 본문이 알려 주지 않아, 피사체가 움직이기 시작하자 모델이 다시 만들어 냈습니다.
해결: 의상, 색, 핵심 소품, 공간 관계 같은 기준점을 도입부 문장에만 두지 말고 움직임을 쓰는 문장까지 끌고 가세요.
원인: 다중 숏용 표현이 단일 숏 작업에 섞였거나, 시점 도약을 편집으로 해석했습니다.
해결: 정말 필요하지 않다면 FL2VA는 한 숏으로 갑니다. 거리와 각도는 카메라 움직임으로, "the camera cuts to"는 새로운 정보에만 씁니다.
원인: 영상 길이와 서술된 동작량이 맞지 않습니다. 6초 분량을 4초에 밀어 넣으면 어딘가는 희생됩니다.
해결: 동작량을 길이에 맞추거나 컷 시점을 옮기세요. 셋 다 잘려 나가는 것보다 하나의 변화를 분명히 보여 주는 편이 낫습니다.
원인: 자연스러운 말 속도로는 길이를 넘기는 대사라, 잘리거나 소리가 끝난 뒤에도 입이 계속 움직입니다.
해결: 초당 2~3단어를 기준으로 잡고 동작 몫도 남기세요. 긴 대사에는 빠른 발화가 아니라 긴 영상이 필요합니다.
원인: 인물이 들을 수 있는 소리를 non_diegetic_music에 썼거나, 환경음 칸이 본문 내용을 되풀이했습니다.
해결: 인물이 듣는 소리는 본문에, 관객만 듣는 음악은 non_diegetic_music에. 환경음 칸은 분위기, 충격음, 숨소리만 정리합니다.
모드 고르기
H3는 키프레임을 네 가지 방식으로 받습니다. 차이는 정렬 문장이며, 여기서 틀리면 참조 이미지가 조용히 무시됩니다.
| 모드 | 이미지 | 정렬 문장 | 통제력 | 이럴 때 선택 |
|---|---|---|---|---|
| T2VA | 텍스트만 | 정렬 문장 없음 | 가장 낮음 | 참조 이미지가 없고 구도와 움직임 모두 모델에 맡기고 싶을 때. |
| I2VA | 첫 프레임 | Picture 1이 0.00초 | 시작 고정 | 도입 화면이 중요하고, 어디서 끝날지는 모델이 정해도 될 때. |
| FL2VA | 첫 + 마지막 프레임 | Picture 1은 0.00초, Picture 2는 끝 | 양 끝 고정 | 시작과 끝 화면이 모두 정해져 있고, 그 사이의 설득력 있는 경로가 필요할 때. |
| L2VA | 마지막 프레임 | Picture 1이 끝 | 끝 고정 | 도착 화면이 고정일 때(로고, 공개, 마지막 포즈). 거기까지 가는 과정은 자유롭게 만들 수 있습니다. |
활용 사례
빌더의 프리셋은 각각 이 중 하나입니다. 형태가 같습니다. 시작 화면 고정, 도착 화면 고정, 그리고 그 사이의 변화가 설득력을 가져야 한다는 점입니다.


이커머스
첫 장은 뜯지 않은 포장, 둘째 장은 제품만 서 있는 화면. 가장 어려운 건 라벨이 끝까지 읽히게 유지하는 일입니다.
6s · 단일 숏 · Live-action, cinematic


리모델링 / 메이크오버
FL2V의 대표 작업입니다. 두 프레임이 같은 방이거나 같은 얼굴이고, 그 사이 경로는 모델이 만들어야 합니다.
8s · 단일 숏 · Live-action


창작 과정
첫 장은 러프, 둘째 장은 완성본입니다. 일러스트, 디자인, 레터링, 3D 턴테이블에도 씁니다.
10s · 단일 숏 · 2D-animated
위의 프레임 쌍은 좋은 FL2VA 입력이 어떤 모습인지 보여 주는 예시입니다. 구도와 조명이 맞고 바뀌는 것은 하나뿐이죠. 참고용 스틸이며 MiniMax H3의 출력이 아닙니다.
사용 방법
FL2VA의 수준은 이 한 쌍이 결정합니다. 변화 자체가 목적이 아니라면 피사체, 렌즈, 조명을 맞추고 두 장 사이에 물리적으로 성립하는 경로가 있는지 확인하세요.
종료 시각은 정렬 문장에 그대로 들어가므로 나중에 바꾸면 프롬프트를 다시 써야 합니다. 지원 범위는 4~15초이고, 변화가 하나라면 6~10초로 대부분 충분합니다.
두 프레임 모두 모델이 보고 있습니다. 본문은 무엇이 움직이는지, 무엇이 손을 옮겨 가는지, 구도가 어떻게 변하는지, 차이가 마지막 프레임을 향해 어떻게 좁혀지는지에 쓰세요.
생성된 프롬프트를 시작 이미지와 끝 이미지를 첨부한 이미지 투 비디오 편집기나 로컬 ComfyUI 그래프에 붙여 넣으세요. 판단 기준은 중간이 예쁜지가 아니라 마지막 프레임에 실제로 도착했는지입니다.
이미지 투 비디오 편집기 열기자주 묻는 질문
FL2VA 프롬프트 형식입니다. 맨 앞에 Picture 1을 0.00초, Picture 2를 영상 끝에 고정하는 정렬 문장을 두고, 이어서 integrated_multimodal_description, overall_soundscape, non_diegetic_music 세 필드를 씁니다. 두 이미지는 H3도 이미 보고 있으므로 본문은 이미지 자체가 아니라 그 사이의 움직임 경로를 설명합니다.
MiniMax가 종료 시각을 S.SS, 즉 소수점 아래 정확히 두 자리로 규정했기 때문입니다. 8초는 8.00이고 8이나 8.0이 아닙니다. 정밀도가 아니라 형식 규칙이며, 이 도구가 대신 써 줍니다.
거의 모든 경우 하나입니다. MiniMax는 첫 프레임에서 마지막까지 연속 보간할 수 있도록 FL2VA에 단일 숏이 낫고, 다중 숏은 명시적으로 필요할 때만 쓰라고 밝히고 있습니다. 컷을 넣더라도 마지막 프레임은 영상 끝에서 마지막 숏이 도달해야 합니다.
네. 첫 화면 생성기의 Image to Video 탭에 시작 프레임 칸과 선택적인 끝 프레임 칸이 있습니다. 두 장을 모두 넣으면 첫·마지막 프레임 작업이 되고, 각각 first_frame_url과 last_frame_url로 H3에 전달됩니다. 여기서 프롬프트를 만들고 실행을 누른 뒤 그곳에서 두 장을 첨부하세요.
이미지 투 비디오(I2VA)는 시작 프레임만 고정하고 어디서 끝날지는 모델이 정합니다. FL2VA는 양 끝을 고정하므로 마무리 화면이 이미 정해진 경우(제품 대표 이미지, 확정된 디자인, 지정된 마지막 포즈)에 적합합니다. 대신 물리적으로 이어지지 않는 한 쌍을 주면 한 장만 줄 때보다 결과가 나빠집니다.
쓸 수 있습니다. 형식이 H3 공개 가중치에 포함된 프롬프트 작성 가이드에서 왔기 때문에 호스팅 API와 로컬 ComfyUI 그래프 모두에서 같은 텍스트가 통합니다. LightX2V의 멀티모달 리라이터는 Qwen3-VL 기반 8B 버전이 되어 first_frame과 last_frame을 직접 읽고 같은 세 필드를 출력합니다.
초당 2~3단어를 기준으로 잡고 동작 몫도 남기세요. 대사는 <d>[Language] ...</d> 태그 안에 넣고 화자 정보는 태그 밖에 씁니다. 설정한 길이에 비해 대사가 길어 보이면 이 도구가 경고합니다.
모델이 무언가를 만들어 내지만 대개 움직임이 아니라 디졸브처럼 보입니다. 경로에 중간 박자를 하나 넣어 변화에 단계를 주거나, 영상을 늘리거나, 두 번의 생성으로 나눠 이어 붙이세요.
이 사이트의 전체 이미지 투 비디오 편집기는 시작 프레임과 끝 프레임을 모두 받아 그대로 MiniMax H3에 넘깁니다. 위에서 프롬프트를 만들고, 편집기를 열어 두 장을 첨부한 뒤, 마지막 프레임에 정말 도착하는지 확인하세요.
이 페이지의 FL2VA 문법(정렬 문장, [Shot N] 컷 표기, 카메라 어휘, 세 개의 출력 필드)은 MiniMaxAI가 H3 공개 가중치와 함께 배포한 Video Prompt Writing Guide에서 가져왔으며 August 2026 기준으로 확인했습니다. 이 사이트는 MiniMax와 제휴 관계가 없습니다.