84 modèles, et la mesure de ce qu'ils valent
Une seule clé donne accès à tous les modèles ci-dessous, chez 7 fournisseurs. Mais donner accès à des modèles, tout le monde sait le faire. Ce qu'on apporte en plus, c'est la mesure : les mêmes scénarios soumis à tous, et le résultat publié — y compris quand il est mauvais.
84modèles qui font le travail
7fournisseurs, une seule clé
455scénarios exécutés
2026-08-03dernière campagne
Comment lire ce tableau. Le taux est la part de scénarios résolus, et le nombre
d'essais est affiché à côté : cinq essais ne font pas une réputation. Un échec peut venir du
modèle comme de notre socle, et les scénarios experts sont durs pour tout le monde. Le coût est
celui d'un scénario moyen — pas un tarif, une mesure.
Les modèles mesurés
| Modèle | Fournisseur | Scénarios résolus | Coût moyen |
|---|---|---|---|
deepseek-chat | Passerelle Doctum | 100 % (5/5) | < 0,001 $ |
deepseek-reasoner | Passerelle Doctum | 100 % (5/5) | < 0,001 $ |
deepseek-v4-flash | DeepSeek | 100 % (5/5) | < 0,001 $ |
bedrock-glm-4-7-flash | Amazon Bedrock | 100 % (5/5) | < 0,001 $ |
bedrock-nova-micro | Amazon Bedrock | 100 % (5/5) | 0.001 $ |
gpt-4o-mini | OpenAI | 100 % (4/4) | 0.001 $ |
gpt-5.6-luna | Passerelle Doctum | 100 % (5/5) | 0.001 $ |
gpt-5.4-nano | Passerelle Doctum | 100 % (5/5) | 0.001 $ |
bedrock-nemotron-nano-3-30b | Amazon Bedrock | 100 % (5/5) | 0.002 $ |
deepseek-v4-pro | DeepSeek | 100 % (5/5) | 0.002 $ |
bedrock-nemotron-super-3-120b | Amazon Bedrock | 100 % (5/5) | 0.002 $ |
bedrock-qwen3-next-80b-a3b | Amazon Bedrock | 100 % (5/5) | 0.002 $ |
scw-gemma-4-26b | Scaleway | 100 % (4/4) | 0.003 $ |
bedrock-ministral-3-8b | Amazon Bedrock | 100 % (5/5) | 0.003 $ |
scw-qwen3-coder-30b | Scaleway | 100 % (4/4) | 0.004 $ |
scw-qwen3.6-35b | Scaleway | 100 % (4/4) | 0.004 $ |
gpt-5.4-mini | Passerelle Doctum | 100 % (5/5) | 0.004 $ |
bedrock-minimax-m2-5 | Amazon Bedrock | 100 % (5/5) | 0.004 $ |
bedrock-ministral-3-14b | Amazon Bedrock | 100 % (5/5) | 0.004 $ |
bedrock-minimax-m2-1 | Amazon Bedrock | 100 % (5/5) | 0.005 $ |
gpt-3.5-turbo-0125 | OpenAI | 100 % (4/4) | 0.005 $ |
bedrock-qwen3-coder-30b-a3b | Amazon Bedrock | 100 % (5/5) | 0.005 $ |
gpt-5-mini | Passerelle Doctum | 100 % (5/5) | 0.006 $ |
scw-qwen3.5-397b | Scaleway | 100 % (4/4) | 0.006 $ |
gpt-5.1 | Passerelle Doctum | 100 % (5/5) | 0.006 $ |
bedrock-devstral-2-123b | Amazon Bedrock | 100 % (5/5) | 0.007 $ |
gpt-5.6-terra | Passerelle Doctum | 100 % (4/4) | 0.009 $ |
gpt-5.2 | Passerelle Doctum | 100 % (5/5) | 0.009 $ |
bedrock-qwen3-vl-235b-a22b | Amazon Bedrock | 100 % (5/5) | 0.013 $ |
gpt-5.4 | Passerelle Doctum | 100 % (5/5) | 0.014 $ |
o4-mini | Passerelle Doctum | 100 % (4/4) | 0.015 $ |
scw-qwen3-235b | Scaleway | 100 % (4/4) | 0.019 $ |
gpt-4o | Passerelle Doctum | 100 % (9/9) | 0.022 $ |
bedrock-claude-haiku-4-5 | Amazon Bedrock | 100 % (5/5) | 0.025 $ |
gpt-5.6 | Passerelle Doctum | 100 % (5/5) | 0.028 $ |
gpt-5.5 | Passerelle Doctum | 100 % (5/5) | 0.034 $ |
gpt-4-turbo | OpenAI | 100 % (4/4) | 0.072 $ |
bedrock-claude-opus-4-5 | Amazon Bedrock | 100 % (5/5) | 0.106 $ |
bedrock-claude-sonnet-4 | Amazon Bedrock | 100 % (5/5) | 0.106 $ |
bedrock-claude-opus-4-6 | Amazon Bedrock | 100 % (5/5) | 0.110 $ |
bedrock-claude-sonnet-4-5 | Amazon Bedrock | 100 % (5/5) | 0.138 $ |
gpt-4 | OpenAI | 100 % (4/4) | 0.225 $ |
gpt-4-0613 | OpenAI | 100 % (4/4) | 0.225 $ |
gpt-4.1-mini | Passerelle Doctum | 89 % (8/9) | 0.002 $ |
gpt-4.1 | Passerelle Doctum | 89 % (8/9) | 0.015 $ |
bedrock-nova-lite | Amazon Bedrock | 80 % (4/5) | 0.001 $ |
bedrock-qwen3-32b | Amazon Bedrock | 80 % (4/5) | 0.003 $ |
bedrock-ministral-3-3b | Amazon Bedrock | 80 % (4/5) | 0.003 $ |
bedrock-nova-2-lite | Amazon Bedrock | 80 % (4/5) | 0.003 $ |
gpt-5.6-sol | Passerelle Doctum | 80 % (4/5) | 0.021 $ |
groq/openai/gpt-oss-20b | Groq | 75 % (3/4) | 0.002 $ |
gpt-5-nano | Passerelle Doctum | 75 % (3/4) | 0.002 $ |
scw-gpt-oss-120b | Scaleway | 75 % (3/4) | 0.003 $ |
o3-mini | Passerelle Doctum | 75 % (3/4) | 0.005 $ |
gpt-3.5-turbo | OpenAI | 75 % (3/4) | 0.005 $ |
gpt-3.5-turbo-16k | OpenAI | 75 % (3/4) | 0.006 $ |
scw-llama-70b | Scaleway | 75 % (3/4) | 0.008 $ |
o3 | Passerelle Doctum | 75 % (3/4) | 0.019 $ |
llama-3.3-70b-versatile | Passerelle Doctum | 71 % (5/7) | 0.006 $ |
bedrock-gpt-oss-20b | Amazon Bedrock | 60 % (3/5) | 0.002 $ |
bedrock-gpt-oss-120b | Amazon Bedrock | 60 % (3/5) | 0.003 $ |
gpt-4.1-nano | Passerelle Doctum | 56 % (5/9) | < 0,001 $ |
groq/openai/gpt-oss-120b | Groq | 50 % (2/4) | 0.002 $ |
bedrock-nova-pro | Amazon Bedrock | 40 % (2/5) | 0.027 $ |
scw-mistral-small-3.2 | Scaleway | 25 % (1/4) | 0.003 $ |
scw-devstral-2 | Scaleway | 25 % (1/4) | 0.007 $ |
scw-gemma-3-27b | Scaleway | 25 % (1/4) | 0.010 $ |
gpt-3.5-turbo-1106 | OpenAI | 25 % (1/4) | 0.011 $ |
scw-mistral-medium-3.5 | Scaleway | 25 % (1/4) | 0.029 $ |
scw-glm-5.2 | Scaleway | 25 % (1/4) | 0.031 $ |
gpt-5-search-api | OpenAI | 25 % (1/4) | 0.111 $ |
bedrock-gemma-3-4b | Amazon Bedrock | 20 % (1/5) | 0.001 $ |
bedrock-nemotron-nano-9b | Amazon Bedrock | 20 % (1/5) | 0.003 $ |
bedrock-gemma-3-12b | Amazon Bedrock | 20 % (1/5) | 0.004 $ |
bedrock-nemotron-nano-12b | Amazon Bedrock | 20 % (1/5) | 0.005 $ |
bedrock-gemma-3-27b | Amazon Bedrock | 20 % (1/5) | 0.006 $ |
bedrock-minimax-m2 | Amazon Bedrock | 20 % (1/5) | 0.006 $ |
bedrock-mistral-7b | Amazon Bedrock | 20 % (1/5) | 0.008 $ |
bedrock-magistral-small | Amazon Bedrock | 20 % (1/5) | 0.020 $ |
bedrock-mixtral-8x7b | Amazon Bedrock | 20 % (1/5) | 0.024 $ |
bedrock-mistral-large-2402 | Amazon Bedrock | 20 % (1/5) | 0.862 $ |
qwen2.5:7b-instruct | Local (Ollama) | 18 % (2/11) | < 0,001 $ |
llama-3.1-8b-instant | Passerelle Doctum | 17 % (1/6) | < 0,001 $ |
qwen2.5-coder:7b | Local (Ollama) | 9 % (1/11) | < 0,001 $ |
Un modèle par rôle, et le relecteur ailleurs que le codeur. Le logiciel ne
choisit pas « le meilleur modèle » — il attelle un codeur, un relecteur, un explorateur et un
testeur, en imposant que le relecteur ne vienne jamais du même fournisseur que le codeur. Deux
modèles issus du même entraînement se trompent ensemble. C'est ce que la campagne permet de
régler, et ce qu'aucun classement général ne dira.
Ces chiffres viennent d'une campagne réelle du 2026-08-03 : mêmes scénarios pour tous les modèles, mêmes critères de réussite. Ils sont republiés à chaque campagne, y compris quand ils sont moins bons — un banc qui n'affiche que ses bons jours ne mesure rien.