MiniMax H3는 범용 멀티모달 생성 모델입니다. 텍스트, 이미지, 비디오, 오디오를 하나의 컨텍스트로 읽고 네이티브 스테레오 사운드가 포함된 비디오를 2K로 최대 15초까지 반환합니다. MiniMax는 가격 대비 성능을 내세우며 2K 기준 초당 비용이 주류 모델의 3분의 1 미만이라고 밝혔고, 모델 가중치를 공개할 계획이라고 발표했습니다.
기능 스냅샷
2K
기본 해상도
15s
최대 클립 길이
stereo
네이티브 오디오
워크플로, 핵심 장점, 결과물을 27초 만에 살펴보세요.
실제 생산 워크플로우에 매핑된 실용적인 가치.
혜택
01
파이프라인 네 개가 아니라 컨텍스트 하나
텍스트, 이미지, 비디오, 오디오가 하나의 컨텍스트로 들어갑니다. 그래서 “이 클립의 카메라 움직임을 가져오고, 이 이미지 속 인물이 노래하게 하고, 이 목소리에 맞춰라”라는 프롬프트가 전문 모델로 쪼개져 전달되는 대신 하나의 지시로 이해됩니다.
혜택
02
소리를 그림과 함께 생성
오디오는 영상과 함께 생성되며 네이티브 스테레오로 나옵니다. 대사, 효과음, 환경음이 나중에 덧입혀지는 대신 처음부터 샷에 맞춰 도착합니다.
혜택
03
더 낮은 초당 비용의 2K
2K가 프리미엄 등급이 아니라 기본값입니다. MiniMax는 H3의 2K 초당 가격을 주류 모델의 3분의 1 미만으로, 768p로 돌릴 때는 주류 720p의 절반 미만으로 제시합니다. 이는 대량 반복의 비용 감각을 바꿉니다.
소스 자료에서 재사용 가능한 결과까지의 간단한 3단계 경로입니다.
단계 1
컨텍스트 모으기
가지고 있는 참조 자료를 준비하세요. 카메라 움직임은 클립으로, 피사체는 이미지로, 목소리는 오디오로.
단계 2
관계 설명하기
참조 자료가 목표 영상과 어떤 관계인지 평범한 말로 적으세요. 모달리티를 넘나드는 추론은 H3가 직접 해결합니다.
단계 3
생성하고 반복하기
2K 스테레오 오디오로 최대 15초를 렌더링한 뒤 반복하세요. 반복이 현실적인 이유는 초당 비용에 있습니다.
최대 15초이며 기본 해상도로 2K를 제공합니다. 768p 등급도 있는데, MiniMax가 가장 낮은 초당 가격을 제시하는 곳이 바로 여기입니다.
H3는 오디오를 영상과 함께 생성하며, 출력은 나중에 섞은 모노 트랙이 아니라 네이티브 스테레오입니다.
MiniMax는 하드웨어 호환성과 커스터마이징을 설계 목표로 들며 모델 가중치를 공개하겠다는 의사를 밝혔습니다. 실제 공개가 이뤄질 때까지는 현재의 보장이 아니라 예정으로 보시는 편이 좋습니다.