Quantification IQ3 : faire tourner de grands modèles IA avec beaucoup moins de mémoire
Faire fonctionner localement un modèle d’intelligence artificielle de plusieurs dizaines de milliards de paramètres reste avant tout une question de mémoire disponible. Un modèle de 20, 30 ou 40 milliards de paramètres utilisé dans sa précision d’origine peut rapidement nécessiter plusieurs dizaines de gigaoctets de RAM ou de VRAM. C’est précisément pour résoudre ce problème … Lire la suite