TurboQuant : Le « cheat code » de Google pour dominer l’IA sans dépenser des milliards et des RAM

Les modèles d’intelligence artificielle générative consomment toujours plus de ressources, au point de faire grimper les prix de la mémoire vive et de saturer les infrastructures des grands centres de données. Face à ce constat, Google Research propose une approche logicielle baptisée TurboQuant qui vise à diminuer fortement l’empreinte mémoire sans sacrifier les performances.
La pénurie de ram et l explosion des besoins en ia
Depuis l’essor rapide des grands modèles de langage, la demande en composants mémoire s’est envolée. Certains observateurs rapportent des hausses de prix pouvant atteindre quatre fois le niveau antérieur sur certains segments, tandis que les opérateurs de datacenters peinent à suivre le rythme d’installation de nouvelles capacités. Plutôt que d’attendre une augmentation massive de la production physique de puces, les équipes de Google explorent des solutions algorithmiques pour réduire la quantité de données que chaque modèle doit conserver en live pendant son fonctionnement.
Un algorithme qui réduit le cache kv à quelques bits
TurboQuant cible spécifiquement le cache key-value, cet espace temporaire qui conserve les informations déjà traitées pour éviter de tout recalculer à chaque nouvelle requête. En convertissant les vecteurs en coordonnées polaires via PolarQuant puis en appliquant une correction résiduelle d’un bit nommée QJL, l’algorithme parvient à ramener chaque valeur à seulement trois ou quatre bits, contre trente-deux en pleine précision. Les tests menés sur les modèles Gemma et Mistral montrent une division par six de l’espace mémoire requis, avec un gain de vitesse pouvant atteindre huit fois sur les calculs d’attention, le tout sans entraînement supplémentaire et sans perte mesurable de qualité sur des tâches de questions-réponses ou de résumé.
Des effets à long terme encore incertains pour le grand public
Si ces avancées se confirment à grande échelle, elles pourraient limiter la demande supplémentaire en composants mémoire de la part des acteurs majeurs de l’ia et ainsi contribuer à une stabilisation, voire une détente, des prix sur plusieurs années. Cependant, le travail reste à l’étape de la recherche et n’a pas encore été intégré dans les produits grand public de Google. Par ailleurs, une efficacité accrue risque aussi d’encourager le développement de modèles encore plus volumineux, déplaçant potentiellement le goulot d’étranglement vers la puissance de calcul des gpu. Pour l’instant, les amateurs qui montent un pc gaming ou un poste de travail puissant devront donc patienter avant de voir un impact direct sur le marché de la ddr5.





