FLUX 3와 mimic의 결합: 로봇이 세상을 이해하는 법

Flux 3 X Mimic: The Next Generation of Video-Action Models

FLUX 3와 mimic의 결합: 로봇이 세상을 이해하는 법

Black Forest Labs는 멀티모달 기반 모델 FLUX 3를 공개하고, 로봇공학 스타트업 mimic와 협력하여 비디오-액션 모델 FLUX-mimic을 개발했다. FLUX 3는 이미지, 비디오, 오디오를 공동으로 생성하도록 처음부터 훈련되었으며, 비디오 예측이 훈련 비용의 95% 이상을 차지할 만큼 가장 어려운 작업이다. 이 과정에서 모델은 물리적 세계의 접촉, 운동, 무게, 인과관계를 학습해야 한다. 연구진은 Self-Flow 프레임워크를 통해 생성 및 표현 학습을 통합하여, 비디오 생성 품질과 로봇 제어 성공률을 동시에 향상시켰다. FLUX-mimic은 FLUX 3의 세계 모델에서 액션을 디코딩하며, Audi 공장에서 실제 배치되어 유연한 부품 조립과 같은 복잡한 작업을 수행한다. 핵심은 하나의 백본이 콘텐츠 생성과 물리적 AI를 모두 지원한다는 것이다.

비디오 생성과 액션 예측은 별도의 기반이 필요하지 않습니다. 동일한 백본이 둘 다를 지원합니다.

이 날의 다른 글

2026-07-24