84 modèles, et la mesure de ce qu'ils valent

Une seule clé donne accès à tous les modèles ci-dessous, chez 7 fournisseurs. Mais donner accès à des modèles, tout le monde sait le faire. Ce qu'on apporte en plus, c'est la mesure : les mêmes scénarios soumis à tous, et le résultat publié — y compris quand il est mauvais.

84modèles qui font le travail
7fournisseurs, une seule clé
455scénarios exécutés
2026-08-03dernière campagne
Comment lire ce tableau. Le taux est la part de scénarios résolus, et le nombre d'essais est affiché à côté : cinq essais ne font pas une réputation. Un échec peut venir du modèle comme de notre socle, et les scénarios experts sont durs pour tout le monde. Le coût est celui d'un scénario moyen — pas un tarif, une mesure.

Les modèles mesurés

ModèleFournisseurScénarios résolus Coût moyen
deepseek-chatPasserelle Doctum100 % (5/5)< 0,001 $
deepseek-reasonerPasserelle Doctum100 % (5/5)< 0,001 $
deepseek-v4-flashDeepSeek100 % (5/5)< 0,001 $
bedrock-glm-4-7-flashAmazon Bedrock100 % (5/5)< 0,001 $
bedrock-nova-microAmazon Bedrock100 % (5/5)0.001 $
gpt-4o-miniOpenAI100 % (4/4)0.001 $
gpt-5.6-lunaPasserelle Doctum100 % (5/5)0.001 $
gpt-5.4-nanoPasserelle Doctum100 % (5/5)0.001 $
bedrock-nemotron-nano-3-30bAmazon Bedrock100 % (5/5)0.002 $
deepseek-v4-proDeepSeek100 % (5/5)0.002 $
bedrock-nemotron-super-3-120bAmazon Bedrock100 % (5/5)0.002 $
bedrock-qwen3-next-80b-a3bAmazon Bedrock100 % (5/5)0.002 $
scw-gemma-4-26bScaleway100 % (4/4)0.003 $
bedrock-ministral-3-8bAmazon Bedrock100 % (5/5)0.003 $
scw-qwen3-coder-30bScaleway100 % (4/4)0.004 $
scw-qwen3.6-35bScaleway100 % (4/4)0.004 $
gpt-5.4-miniPasserelle Doctum100 % (5/5)0.004 $
bedrock-minimax-m2-5Amazon Bedrock100 % (5/5)0.004 $
bedrock-ministral-3-14bAmazon Bedrock100 % (5/5)0.004 $
bedrock-minimax-m2-1Amazon Bedrock100 % (5/5)0.005 $
gpt-3.5-turbo-0125OpenAI100 % (4/4)0.005 $
bedrock-qwen3-coder-30b-a3bAmazon Bedrock100 % (5/5)0.005 $
gpt-5-miniPasserelle Doctum100 % (5/5)0.006 $
scw-qwen3.5-397bScaleway100 % (4/4)0.006 $
gpt-5.1Passerelle Doctum100 % (5/5)0.006 $
bedrock-devstral-2-123bAmazon Bedrock100 % (5/5)0.007 $
gpt-5.6-terraPasserelle Doctum100 % (4/4)0.009 $
gpt-5.2Passerelle Doctum100 % (5/5)0.009 $
bedrock-qwen3-vl-235b-a22bAmazon Bedrock100 % (5/5)0.013 $
gpt-5.4Passerelle Doctum100 % (5/5)0.014 $
o4-miniPasserelle Doctum100 % (4/4)0.015 $
scw-qwen3-235bScaleway100 % (4/4)0.019 $
gpt-4oPasserelle Doctum100 % (9/9)0.022 $
bedrock-claude-haiku-4-5Amazon Bedrock100 % (5/5)0.025 $
gpt-5.6Passerelle Doctum100 % (5/5)0.028 $
gpt-5.5Passerelle Doctum100 % (5/5)0.034 $
gpt-4-turboOpenAI100 % (4/4)0.072 $
bedrock-claude-opus-4-5Amazon Bedrock100 % (5/5)0.106 $
bedrock-claude-sonnet-4Amazon Bedrock100 % (5/5)0.106 $
bedrock-claude-opus-4-6Amazon Bedrock100 % (5/5)0.110 $
bedrock-claude-sonnet-4-5Amazon Bedrock100 % (5/5)0.138 $
gpt-4OpenAI100 % (4/4)0.225 $
gpt-4-0613OpenAI100 % (4/4)0.225 $
gpt-4.1-miniPasserelle Doctum89 % (8/9)0.002 $
gpt-4.1Passerelle Doctum89 % (8/9)0.015 $
bedrock-nova-liteAmazon Bedrock80 % (4/5)0.001 $
bedrock-qwen3-32bAmazon Bedrock80 % (4/5)0.003 $
bedrock-ministral-3-3bAmazon Bedrock80 % (4/5)0.003 $
bedrock-nova-2-liteAmazon Bedrock80 % (4/5)0.003 $
gpt-5.6-solPasserelle Doctum80 % (4/5)0.021 $
groq/openai/gpt-oss-20bGroq75 % (3/4)0.002 $
gpt-5-nanoPasserelle Doctum75 % (3/4)0.002 $
scw-gpt-oss-120bScaleway75 % (3/4)0.003 $
o3-miniPasserelle Doctum75 % (3/4)0.005 $
gpt-3.5-turboOpenAI75 % (3/4)0.005 $
gpt-3.5-turbo-16kOpenAI75 % (3/4)0.006 $
scw-llama-70bScaleway75 % (3/4)0.008 $
o3Passerelle Doctum75 % (3/4)0.019 $
llama-3.3-70b-versatilePasserelle Doctum71 % (5/7)0.006 $
bedrock-gpt-oss-20bAmazon Bedrock60 % (3/5)0.002 $
bedrock-gpt-oss-120bAmazon Bedrock60 % (3/5)0.003 $
gpt-4.1-nanoPasserelle Doctum56 % (5/9)< 0,001 $
groq/openai/gpt-oss-120bGroq50 % (2/4)0.002 $
bedrock-nova-proAmazon Bedrock40 % (2/5)0.027 $
scw-mistral-small-3.2Scaleway25 % (1/4)0.003 $
scw-devstral-2Scaleway25 % (1/4)0.007 $
scw-gemma-3-27bScaleway25 % (1/4)0.010 $
gpt-3.5-turbo-1106OpenAI25 % (1/4)0.011 $
scw-mistral-medium-3.5Scaleway25 % (1/4)0.029 $
scw-glm-5.2Scaleway25 % (1/4)0.031 $
gpt-5-search-apiOpenAI25 % (1/4)0.111 $
bedrock-gemma-3-4bAmazon Bedrock20 % (1/5)0.001 $
bedrock-nemotron-nano-9bAmazon Bedrock20 % (1/5)0.003 $
bedrock-gemma-3-12bAmazon Bedrock20 % (1/5)0.004 $
bedrock-nemotron-nano-12bAmazon Bedrock20 % (1/5)0.005 $
bedrock-gemma-3-27bAmazon Bedrock20 % (1/5)0.006 $
bedrock-minimax-m2Amazon Bedrock20 % (1/5)0.006 $
bedrock-mistral-7bAmazon Bedrock20 % (1/5)0.008 $
bedrock-magistral-smallAmazon Bedrock20 % (1/5)0.020 $
bedrock-mixtral-8x7bAmazon Bedrock20 % (1/5)0.024 $
bedrock-mistral-large-2402Amazon Bedrock20 % (1/5)0.862 $
qwen2.5:7b-instructLocal (Ollama)18 % (2/11)< 0,001 $
llama-3.1-8b-instantPasserelle Doctum17 % (1/6)< 0,001 $
qwen2.5-coder:7bLocal (Ollama)9 % (1/11)< 0,001 $
Un modèle par rôle, et le relecteur ailleurs que le codeur. Le logiciel ne choisit pas « le meilleur modèle » — il attelle un codeur, un relecteur, un explorateur et un testeur, en imposant que le relecteur ne vienne jamais du même fournisseur que le codeur. Deux modèles issus du même entraînement se trompent ensemble. C'est ce que la campagne permet de régler, et ce qu'aucun classement général ne dira.

Ces chiffres viennent d'une campagne réelle du 2026-08-03 : mêmes scénarios pour tous les modèles, mêmes critères de réussite. Ils sont republiés à chaque campagne, y compris quand ils sont moins bons — un banc qui n'affiche que ses bons jours ne mesure rien.