Multiplayer Interactive World Models with Representation Autoencoders
Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao 외
단일 플레이어 월드 모델의 한계를 넘어, 여러 에이전트의 상호작용을 모델링하여 복잡한 물리 환경에서 실시간으로 멀티플레이어 게임 장면을 생성하는 잠재 확산 모델을 제안합니다.
기존의 단일 플레이어 월드 모델은 다른 에이전트를 환경의 일부로 취급하여, 여러 플레이어가 빠르고 긴밀하게 상호작용하는 복잡한 멀티플레이어 환경의 역학을 정확히 모델링하기 어렵습니다.
10,000시간의 게임 플레이 데이터로 훈련된 50억 파라미터의 잠재 확산 모델을 개발했습니다. 모델은 비디오 코덱, 생성 목표, 멀티플레이어 조건화 방식 등 핵심 설계 선택지를 체계적으로 연구했습니다.
단일 Nvidia B200 GPU에서 초당 20프레임으로 4인 매치를 실시간 생성하며, 훈련 구간을 훨씬 넘어선 5분까지 분포 품질이 안정적으로 유지됩니다. 데이터셋, 전체 훈련 및 추론 코드베이스, 라이브 데모를 공개하여 후속 연구를 지원합니다.