xAI
Grok Imagine 1.0 Video
시작가 $0.009 초당
이 모델로 구축하고 배포할 수 있는 실제 워크플로우와 프로덕션 활용 사례입니다.

텍스트는 출발점일 뿐 지시의 전부가 아닙니다. FLUX 3에는 움직이게 할 첫 프레임, 캐릭터를 고정하는 참조 이미지, 요소를 새 장면으로 옮겨올 원본 클립, 또는 전환의 시작과 끝을 정의하는 두 개의 키프레임을 건넬 수 있습니다. 기존 영상과 그 오디오를 이어서 만들 수도 있어, 한 컷을 처음부터 다시 만들지 않고 늘릴 수 있습니다.
FLUX 3 문서 읽기
FLUX 3는 다국어 대사를 처리하고 화면 안에 읽히는 텍스트를 렌더링하므로, 하나의 크리에이티브 방향을 여러 시장으로 옮길 수 있습니다. 간판과 타이틀, 애니메이션 타이포그래피는 나중에 합성하는 것이 아니라 장면의 일부로 생성되며, 음성 트랙도 화면과 함께 만들어집니다. Black Forest Labs의 자체 초기 평가에 따르면 표정 표현과 다국어 처리는 FLUX 3가 이미 특히 강한 영역입니다.

같은 FLUX 3 백본이 스타일과 화면비, 해상도를 넘나들며 이미지를 생성·편집하고, 그 정지 이미지를 움직임으로 확장합니다. 형태와 색, 재질, 브랜드 요소가 제품 컷과 영상 사이에서 알아볼 수 있게 유지되는데, 둘 다 하나의 모델에서 나오기 때문입니다. 이미지 생성기에 별도의 영상 생성기를 덧붙인 구조가 아닙니다.
FLUX 3는 멀티모달 생성과 이해를 정렬하기 위한 Black Forest Labs의 접근법인 Self-Flow 위에서, 통합된 아키텍처 안에서 이미지와 영상, 오디오로부터 학습합니다. 각 모달리티는 서로를 제약합니다. 소리는 충격과 맞아야 하고, 움직임은 질량을 따라야 합니다.
FLUX 3의 모든 영상 출력에는 같은 생성에서 나온 네이티브 오디오가 함께합니다. 대사와 환경음, 충격음이 원래 있어야 할 프레임에 놓이며, 무음 영상에 나중에 타이밍을 맞출 필요가 없습니다.
FLUX 3는 개별 생성을 몇 분 길이의 멀티숏 시퀀스로 연결하고, 시각 참조가 장면 사이에서 캐릭터와 장소를 안정적으로 유지합니다. 20초는 한 번의 생성 상한일 뿐, 완성된 결과물의 상한이 아닙니다.
Black Forest Labs의 자체 초기 평가에서 비교 대상 가운데 이 둘이 가장 가까웠습니다. 시청자가 FLUX 3를 선호한 비율은 52%로 사실상 동전 던지기입니다. 차이는 이용 가능 여부와 범위에 있습니다. Seedance 2.0은 지금 reAPI에서 바로 호출할 수 있고, FLUX 3는 아직 단계적으로 공개되는 더 넓은 멀티모달 기반 모델입니다.
이 비교는 작성 시점에 공개된 동작을 기준으로 합니다. 52%라는 선호도 수치는 Black Forest Labs가 직접 수행한 예비 평가(10초 720p 텍스트-투-비디오, 오디오 포함)에서 나온 것이며, 해당 모델은 회사 스스로 아직 개발 중이라고 밝혔습니다. 표본 크기와 방법론은 공개되지 않았고 독립적인 벤치마크가 아닙니다.
이 모델에 대한 일반적인 질문입니다.