Un modèle de 27 milliards de paramètres dont les poids tiennent dans 5,93 Go : c'est ce qu'annonce PrismML avec Bonsai 2 27B, sorti le 17 septembre. La première version atteignait environ 95 % des performances de son modèle de référence ; cette nouvelle génération basée sur Qwen3.8 monte à 98,2 %, selon les tests de l'éditeur. Mais ces 5,93 Go ne correspondent pas à toute l'installation, et le modèle ne fonctionne toujours pas directement dans Ollama.
Mon verdict en 30 secondes : les chiffres de PrismML sont impressionnants, mais ce sont les siens, et je n'ai trouvé aucun test indépendant de cette version au 18 septembre 2026. Pour l'utilisateur lambda, rien ne change tant que le modèle n'arrive pas dans les outils grand public.
Ce que PrismML annonce
Selon l'annonce officielle de PrismML, Bonsai 2 27B est une version compressée de Qwen3.8 27B. Ses poids sont ternaires : chacun vaut -1, 0 ou +1, soit 1,76 bit effectif par poids, contre 16 bits pour un modèle classique. Résultat annoncé : 5,9 Go, plus de neuf fois moins que l'original.
Le modèle accepte le texte et les images, gère un contexte de 262 144 tokens (les unités de texte que le modèle traite) et sort sous licence Apache 2.0, qui autorise l'usage commercial.
Sur une batterie de tests couvrant raisonnement, maths, code, vision et usage d'outils, PrismML annonce un score global de 83,9, contre 85,4 pour Qwen3.8 27B en pleine précision. D'où les 98,2 %. Il annonce aussi jusqu'à 143 tokens par seconde sur une RTX 5090.
95 % puis 98 % : attention, deux références différentes
Le premier Bonsai 27B, sorti en juillet, gardait environ 95 % des performances de Qwen3.6 27B. Bonsai 2 en garde 98,2 %, mais de Qwen3.8 27B. Les deux pourcentages ne se mesurent pas contre le même modèle. « On passe de 95 à 98 % » résume donc le progrès de la méthode de compression, pas un gain de trois points sur une même échelle.
Le chiffre le plus parlant du tableau de PrismML est ailleurs. Bonsai 2 compressé obtient 83,9 au score global, contre 83,6 pour Qwen3.6 27B non compressé. Autrement dit, toujours selon l'éditeur, la version de 6 Go de la nouvelle génération fait jeu égal avec l'ancienne génération complète. Pour mémoire, la documentation PrismML rappelle qu'un modèle de 27 milliards de paramètres en 16 bits demande environ 54 Go pour ses seuls poids.
Un détail m'a arrêté : en suivi d'instructions, Bonsai 2 fait mieux que le modèle dont il est tiré (82,66 contre 81,25). Un modèle compressé qui dépasse l'original n'a rien d'impossible, mais c'est le genre de résultat qu'il faut voir confirmé par quelqu'un d'autre que l'éditeur.
Pourquoi ça compte quand la mémoire coûte cher
À mon sens, l'intérêt de ce genre de recherche dépasse Bonsai. La mémoire vive et la VRAM coûtent cher en 2026, et les fabricants de cartes graphiques n'en donnent pas plus pour autant. Si le matériel ne suit pas, la compression devient l'une des voies réalistes pour faire tourner des modèles de cette taille chez soi.
J'ai vécu cette question de la VRAM en choisissant ma carte graphique : l'écart entre les versions 8 et 16 Go faisait tout le débat.
→ Voir aussi : J'ai vendu ma RTX 5060 pour une RX 9060 XT 16 Go
5,93 Go sur le papier, davantage en pratique
Les 5,93 Go correspondent au format PTQ1_0, le plus compact. Le format PQ2_0, téléchargé par défaut par la démonstration, pèse 7,25 Go et accélère le traitement des prompts. Il faut encore ajouter le projecteur de vision, environ 0,63 Go selon la documentation, puis le cache de contexte, dont la taille dépend de la longueur de la conversation. La documentation de démarrage évalue ainsi le téléchargement par défaut à environ 7,8 Go, vision incluse.
Les 5,93 Go désignent donc les poids du modèle linguistique, pas l'installation complète. Le détail des formats est dans la documentation des formats PrismML.
PrismML ne publie aucun chiffre de mémoire totale en fonctionnement pour ce modèle. Je ne peux donc pas te dire si Bonsai 2 tient sur une carte de 8 Go en usage réel : le chiffre n'existe pas encore publiquement.
Le vrai frein : ni Ollama, ni llama.cpp standard
C'est le point que l'annonce ne met pas en avant. La documentation des formats est explicite : Bonsai 2 a besoin d'une transformation mathématique au moment de l'exécution, qui n'est pas encore intégrée à llama.cpp, le moteur utilisé par la plupart des outils d'IA locale. Il faut donc passer par la version modifiée de llama.cpp maintenue par PrismML.
Conséquence directe, écrite noir sur blanc par l'éditeur : les outils qui embarquent llama.cpp standard, dont Ollama dans ses versions actuelles, ne peuvent pas faire tourner Bonsai 2. La documentation signale même un piège : un certain type de fichier se charge sans message d'erreur, puis produit du charabia. LM Studio n'est documenté par PrismML que pour le modèle Ternary Bonsai 27B précédent, sur Mac Apple Silicon, pas pour Bonsai 2 27B.
L'installation elle-même n'est plus le problème. PrismML fournit un script Windows PowerShell qui installe tout, ainsi que des binaires Windows pour les cartes Nvidia (CUDA) comme pour les cartes AMD (Vulkan et HIP/ROCm). J'ai une RX 9060 XT 16 Go, mais je n'ai pas lancé Bonsai 2 dessus. Je ne te dirai donc pas qu'il y tourne.
Ce qu'on ne sait pas encore
Au 18 septembre, je n'ai trouvé aucun test indépendant de Bonsai 2. Il en existe un pour la première version, publié sur GitHub, réalisé sur une RTX 5060 Ti de 16 Go sous Linux et CUDA. Il conclut que le modèle est excellent pour un utilisateur seul, mais moins adapté au service de plusieurs utilisateurs simultanément. Rien ne garantit que ces conclusions s'appliquent à Bonsai 2.
Mon verdict
Pour moi, Bonsai 2 reste une curiosité technique à suivre. Si les chiffres de PrismML se confirment, le progrès est réel : un modèle de 6 Go qui rivalise avec la génération précédente entière, c'est exactement ce dont l'IA locale a besoin quand la mémoire coûte cher.
Pour l'utilisateur grand public, ce n'est pas encore un modèle à lancer en deux clics depuis Ollama. Pour quelqu'un qui accepte PowerShell ou la ligne de commande, la démo officielle permet déjà de l'essayer. Le signal que je surveille, c'est son arrivée dans llama.cpp standard puis dans Ollama, plus que le prochain pourcentage.
FAQ
Bonsai 2 27B fonctionne-t-il avec Ollama ?
Non, pas à ce jour. La documentation de PrismML précise que les versions actuelles d'Ollama, qui embarquent llama.cpp standard, ne peuvent pas le faire tourner. Il faut passer par la version modifiée de llama.cpp fournie par PrismML.
Combien de mémoire faut-il pour Bonsai 2 27B ?
Les poids pèsent 5,93 Go dans le format le plus compact, et le téléchargement par défaut atteint environ 7,8 Go avec la vision. S'y ajoute le cache de contexte, dont PrismML ne publie pas la taille totale pour ce modèle.
Bonsai 2 27B tourne-t-il sur une carte graphique AMD ?
PrismML fournit des binaires Windows Vulkan et HIP/ROCm pour les cartes AMD. Je ne l'ai pas vérifié moi-même, et aucun test indépendant ne l'a confirmé à ma connaissance.
Les 98,2 % de performances sont-ils fiables ?
Ce sont les chiffres de l'éditeur, mesurés sur ses propres tests. Je n'avais trouvé aucun test indépendant de Bonsai 2 au 18 septembre 2026. Tant que ce n'est pas le cas, prends ce pourcentage comme une annonce, pas comme un résultat établi.
