Anthropic a présenté Claude Sonnet 5.5, doté de capacités améliorées en matière de programmation, d’analyse de données et d’exécution de tâches en plusieurs étapes.

Vitesse et économie de jetons

Par rapport à Claude Sonnet 3.5, le nouveau modèle génère des réponses plus de 30 % plus rapidement, et les coûts d’exécution des tâches, selon les tests d’Anthropic, pourraient diminuer jusqu’à 30 % sans modification des tarifs API.

Claude Sonnet 3.5 combine plus efficacement les appels d’outils et exécute les tâches en moins d’étapes, consommant moins de jetons pour obtenir un résultat similaire.

Un million de jetons de contexte

Sonnet 5.5 a conservé une fenêtre contextuelle de 1 million de jetons et une longueur de réponse maximale allant jusqu’à 128 000 jetons. Cela permet de travailler avec des documents volumineux, des bases de code et de grands ensembles de données dans le cadre d’une seule requête.

Le modèle accepte du texte et des images, y compris des captures d’écran, des graphiques et des interfaces.

Améliorations en programmation

Anthropic a enregistré la progression la plus notable dans le test Terminal-Bench 4.0, qui évalue la capacité d’une IA à utiliser le terminal de manière autonome et à exécuter des tâches en plusieurs étapes. Claude Sonnet 5.5 a obtenu un score de 70,6 %, contre 10,3 % pour la précédente Sonnet 5.

Le modèle est capable d’analyser le code, de corriger les erreurs, d’exécuter des tests et de poursuivre le travail sans avoir besoin de définir manuellement chaque action suivante.

Travail sur des documents et des graphismes

Anthropic a également amélioré la création de tableaux, de présentations, de fichiers JSON et de documents structurés. Selon les résultats des tests préliminaires, Sonnet 5.5 suit plus précisément les modèles complexes et génère des contenus nécessitant moins de corrections manuelles.

La reconnaissance des informations visuelles a nettement progressé. Dans le test Chartography, le modèle a obtenu 61,6 % contre 15,6 % pour Sonnet 5. Ce benchmark évalue la capacité de l’IA à comprendre les graphiques et les diagrammes sans outils supplémentaires.

Résultats des benchmarks

Anthropic a publié les résultats comparatifs de Claude Sonnet 5.5 et de la précédente Sonnet 5 dans sept tests couvrant la programmation, l’utilisation de l’ordinateur, l’analyse d’images et la résolution de problèmes complexes.

BenchmarkSonnet 5Sonnet 5.5
Terminal-Bench 4.0 (programmation)10,3 %70,6 %
CursorBench 4.0 (programmation)34,1 %55,5 %
GDPval-AA v2.1 (tâches de travail, indice)14491844
AA-Briefcase v1.1 (tâches professionnelles, index)13591811
Le dernier examen de l’humanité (avec des outils)54,9 %64,5 %
OSWorld 2.1 (gestion d’ordinateur, test partiel)57,0 %80,1 %
Chartographie (analyse de graphiques sans outils)15,6 %61,6 %

Tous les indicateurs sont basés sur les résultats publiés par Anthropic. Les scores indexés sont utilisés pour GDPval-AA et AA-Briefcase, tandis que les autres tests utilisent des pourcentages. Un résultat plus élevé indique une meilleure exécution des tâches dans le cadre du benchmark correspondant.

Disponibilité et prix

Claude Sonnet 5.5 est sortie le 28/09/2026 et est déjà disponible dans les applications Claude, via le API officiel, Amazon Web Services, Google Cloud et Microsoft Azure.

Coût d’utilisation via API pour 1 million de jetons :

  • Jetons d’entrée – $2 ;
  • Jetons de sortie – $10 ;
  • Lecture depuis le cache – $0,20 ;
  • Mise en cache pendant 5 minutes – $2,50 ;
  • Mise en cache pendant 1 heure – $4.

Pour les développeurs, le modèle est disponible sous l’identifiant claude-sonnet-5-5.

Suivre MobiDevices
Telegram