Louis Béthune, Vítor Turrisi, Bruno Kacper Mlodozeniec, Pau Rodríguez López, Lokesh Boominathan, Nikhil Bhendawade, Amitis Shidani, Joris Pelemans, Theo X. Olausson, Devon Hjelm, Paul Dixon, João Monteiro, Pierre Ablin, Vishnu Banna, Arno Blaas, Nick Henderson, Kari Noriy, Dan Busbridge, Josh Susskind, Marco Cuturi, Irina Belousova, Luca Zappella, Russ Webb, Jason Ramapuram
This effort trained 3B tri-modal masked-diffusion models on text, image, and audio at 6T-token scale.
It covers the tri-modal design space: tokenization, noise schedules, loss weighting, modality balancing,
zero-shot hyper-parameter transfer and scaling laws.
Paper