Aller au contenu
V-Smart.

Les modèles que nous avons testés — et ceux qui sont restés

Trente-deux versions configurées de modèles sont passées par la machine. Dix profils de travail, construits sur quatre fichiers, sont restés à demeure. Voici ce qui décidait d'une promotion ou d'une élimination — et pourquoi le fichier le plus coûteux n'est pas toujours le meilleur.

Quatre fichiers, dix façons de travailler

Un modèle, c’est un fichier sur le disque, mais le même fichier peut être exposé de plusieurs manières : avec ou sans raisonnement, avec des réglages pour la conversation ou pour le code. Cela ne coûte pas de mémoire — la machine ne garde de toute façon qu’un modèle à la fois. Ainsi, quatre fichiers (environ 70 Go au total) servent dix profils.

ModèleÉcritLitContexteVoit l’imageAffectation
Gemma 4, 26 Md (à experts)200/s7 011/s262 000ouichoix par défaut pour tout
Qwen 3.6, 35 Md (à experts)132–185/s4 970/s262 000noncode et travail en agent
Gemma 4, 31 Md (classique)72/s2 204/s164 000ouile meilleur polonais de la sélection, documents
Qwen 3.6, 27 Md (classique)59–72/s2 100/s262 000nontâches exigeant de la précision

Les nombres sont des tokens par seconde : écriture de la réponse et lecture du texte d’entrée.

À experts ou classique — la seule différence qu’il faut comprendre

Un modèle classique recalcule tous ses paramètres à chaque mot. Un modèle à experts se divise en de nombreux spécialistes et n’en active que quelques-uns à la fois — sur 35 milliards de paramètres, trois travaillent réellement. Effet : il est nettement plus rapide à taille de fichier égale.

Cela ressemble à un gain pur, mais ce n’en est pas un. Dans le test de programmation, où les modèles écrivaient des projets en autonomie, toutes les variantes ont mis un temps presque identique — de 3,78 à 3,80 heures pour la série de dix tâches, malgré un écart de deux fois et demie en vitesse d’écriture. Elles arrivaient au but par des chemins différents : le classique génère lentement mais se trompe rarement (834 étapes), le modèle à experts génère vite et se rattrape par les essais (1 987 étapes).

La différence pratique est ailleurs : le classique consomme 39 % de contexte en moins, ce qui compte quand on travaille sur un grand projet existant. Le modèle à experts en fait davantage — 44 % de tests en plus et 26 % de code en plus.

Compression du modèle : ce que nous concédons, et ce que nous ne concédons pas

Les modèles sont publiés en pleine précision, mais à la maison on télécharge une version compressée — sinon rien ne tiendrait. Nous avons vérifié ce que cette compression coûte réellement en qualité.

Nous avons fait passer au même modèle une batterie de tâches (polonais, raisonnement, code, casse-têtes logiques) à trois degrés de compression : forte, moyenne et légère. Les trois ont réussi sans différence de qualité. Les casse-têtes résolus correctement à chaque passage.

Une compression plus légère, en revanche, coûte du concret : sur le modèle classique, à la fois la vitesse et le contexte (passer à une précision nettement meilleure, c’est −25 % de vitesse) ; sur le modèle à experts, presque uniquement le contexte. Puisque la qualité ne s’améliore pas et que le contexte fond — le choix allait de soi. En production tourne la version fortement compressée.

Il y a une exception digne d’attention. Les modèles Gemma sont préparés à la compression dès l’entraînement et la supportent donc remarquablement bien. C’est notamment pour cela qu’ils offrent chez nous le meilleur rendu de notre polonais natal de toute la sélection — et leur qualité multilingue laisse attendre le même niveau dans votre langue.

Ce qui a été écarté, et pourquoi

Le modèle polonais (Bielik, 11 Md). Un polonais naturel, un raisonnement et un code corrects, des réponses directes sans longues délibérations. Il est tombé sur deux points : son contexte s’arrête à 32 768 tokens (limite du modèle lui-même) et il ne prend pas en charge l’accélération par souffleur. Dans un ensemble où le reste tourne à 262 000 tokens de contexte, il lui était difficile de trouver un emploi.

Les Gemma plus petits (12 Md). Seuls de la sélection à voir l’image, la vidéo et à entendre le son, avec un polonais élégant et des résultats sensés. Ils sont restés hors production parce que les modèles plus grands tiennent sans difficulté — et puisqu’ils tiennent, aucune raison de descendre plus bas.

Le modèle spécialisé en code (30 Md). Il utilise un autre format d’appel des outils que le reste et exige une préparation à part. Il attend son évaluation de qualité ; son contexte et sa mémoire sont déjà vérifiés.

La lecture obéit à un autre classement que l’écriture

Cela vaut la peine d’être distingué, car le choix du modèle dépend de ce qu’on en fait.

En écriture, c’est la bande passante mémoire de la carte qui décide — là gagnent les modèles à experts avec souffleur (140–200 tokens par seconde). En lecture, c’est la puissance de calcul qui décide, et les deux cartes se partagent réellement le travail. Le classement change : les grands modèles classiques y font trois fois moins bien que les modèles à experts de la même classe, et les petits modèles classiques remontent haut, car leurs poids sont légers.

Règle pratique : quand la requête est surtout de la matière à lire (revue de projet, long document) — c’est la lecture qui compte. Quand la question est courte et la réponse longue — c’est l’écriture qui compte.

Les réglages peuvent coûter plus cher que le choix du modèle

Le résultat le plus surprenant de cette série. Le même modèle, le même fichier, la même mémoire — seule différence : les réglages de génération recommandés par l’éditeur pour le mode sans raisonnement. Coût : 29 % de vitesse d’écriture (132 contre 185 tokens par seconde).

Le mécanisme se comprend : ces réglages modifient la distribution de probabilité des mots suivants, le souffleur devine donc moins souvent juste et le gain de la spéculation fond. Conclusion pour quiconque règle une telle machine : les pénalités de répétition coûtent plus cher dans une configuration avec souffleur que dans une configuration ordinaire — en évaluant la qualité de sortie, il faut regarder la vitesse en même temps.


Tous les chiffres proviennent de nos propres mesures : 2 × RTX 5070 Ti 16 Go, un modèle à la fois, mesures via le même serveur que nous utilisons au quotidien.