Google vient de tuer le « penseur lent » : cette IA écrit 4x plus vite que ChatGPT sur ton PC !

Google DeepMind frappe fort avec un nouveau venu dans l’écosystème Gemma. DiffusionGemma, un modèle expérimental ouvert, promet d’accélérer drastiquement la création de texte grâce à une méthode radicalement différente des approches classiques. Plutôt que de produire les mots un à un, il mise sur la génération parallèle et affine le résultat en plusieurs passes.
Une architecture qui rompt avec la méthode traditionnelle
La plupart des grands modèles de langage avancent séquentiellement, prédisant le token suivant à partir du contexte déjà généré. DiffusionGemma abandonne cette logique linéaire pour traiter un bloc entier de texte simultanément. Il commence par une version brouillée remplie de jetons aléatoires, puis raffine l’ensemble à travers plusieurs itérations jusqu’à obtenir une sortie cohérente. Cette inspiration directe des techniques de diffusion utilisées pour les images permet d’exploiter pleinement la puissance de calcul des GPU modernes en traitant jusqu’à 256 jetons en parallèle grâce à une attention bidirectionnelle.
Des performances chiffrées qui attirent l’œil des développeurs
Selon les tests menés par Google, le modèle peut dépasser les 1 000 jetons par seconde sur des accélérateurs haut de gamme comme le H100. Sur des cartes grand public telles que l’RTX 5090, les débits approchent souvent les 700 jetons par seconde. L’architecture s’appuie sur un Mixture of Experts totalisant 26 milliards de paramètres, mais n’en active que 3,8 milliards lors de l’inférence. Cela réduit la consommation mémoire et rend le déploiement plus accessible sur du matériel local relativement puissant. Le modèle, diffusé sous licence Apache 2.0 et disponible sur Hugging Face, bénéficie également d’un support natif dans vLLM.
Une vitesse gagnée au prix d’un léger compromis qualitatif
Google reconnaît sans détour que cette rapidité s’accompagne d’une baisse de la qualité globale par rapport aux versions standard de Gemma 4. DiffusionGemma n’est donc pas destiné à remplacer les modèles les plus performants, mais plutôt à servir dans des scénarios où la latence minimale prime, comme les applications interactives en temps réel ou le prototypage rapide. Multimodal, il accepte des entrées textuelles, images ou vidéos pour produire du texte et ouvre des pistes intéressantes pour les workflows locaux nécessitant une réactivité immédiate.






