Ralentir l'IA ? Opus 5.5, GPT-6 Sol et Grok 4.7 sortent en 36 heures

Le 12 septembre, les trois patrons les plus puissants de l'IA se sont mis d'accord pour la première fois. Dario Amodei, d'Anthropic, a écrit que l'IA avançait trop vite. Elon Musk a répondu qu'il avait raison. Sam Altman, d'OpenAI, a approuvé à son tour, avec une nuance : ralentir ne veut pas dire s'arrêter. Dix jours plus tard, on a compris ce qu'il voulait dire.

Didier Sampaolo Didier Sampaolo 3 min de lecture
Nouveaux modèles : GPT6 Sol et Luna, Grok 4.7, Opus 5.5
Sommaire
En résumé :
  • Le 12 septembre, Amodei, Altman et Musk appellent à ralentir l'IA.
  • Dix jours plus tard, Grok 4.7, Opus 5.5 et GPT-6 Sol et Luna sortent en 36 heures.
  • Les prix baissent : 20 % de moins sur Opus, 50 % chez OpenAI, même prix pour un Grok plus gros.
  • Les fenêtres de contexte plafonnent autour d'un million de tokens.

Le 21 septembre, xAI sort Grok 4.7. Le 22 au matin, Anthropic publie Claude Opus 5.5. Quatre-vingt-dix minutes plus tard, OpenAI répond avec GPT-6 Sol et GPT-6 Luna, deux fois moins chers que leurs prédécesseurs.

Claude Opus 5.5 (Anthropic)

Anthropic a sorti Opus 5.5 le 22 septembre. Le modèle coûte 4 $ par million de tokens en entrée et 20 $ en sortie, soit 20 % de moins qu'Opus 5. La lecture du cache baisse de 60 %, à 0,20 $ par million de tokens. Ce poste pèse lourd dans le travail des agents qui tournent longtemps.

Anthropic estime la baisse totale à 40 % sur une charge de travail typique. La différence vient du fait que le modèle consomme aussi moins de tokens pour la même tâche.

La fenêtre de contexte reste à 1 million de tokens, avec une sortie maximale de 128 000 tokens.

GPT-6 Sol et GPT-6 Luna (OpenAI)

OpenAI a sorti ses deux modèles 90 minutes après Anthropic. GPT-6 Sol coûte 2 $ en entrée et 10 $ en sortie. GPT-6 Luna coûte 0,10 $ et 0,50 $. Moitié moins chers que leurs prédécesseurs, dont les prix étaient présentés comme promotionnels. Un employé d'OpenAI a confirmé que les prix de GPT-6 étaient définitifs.

Luna garde une fenêtre de 1,05 million de tokens et une sortie maximale de 128 000 tokens. Attention : au-delà de 272 000 tokens en entrée, toute la requête coûte deux fois plus cher en entrée et 1,5 fois plus cher en sortie.

Grok 4.7 (xAI)

xAI a sorti Grok 4.7 la veille, le 21 septembre. Le prix ne bouge pas par rapport à Grok 4.6 : 2 $ en entrée et 6 $ en sortie. Le modèle, lui, grossit. Selon Elon Musk, il passe à 2 100 milliards de paramètres, contre 1 500 milliards pour Grok 4.6. La fenêtre de contexte monte à 500 000 tokens.

Le prix bas a une contrepartie. Sur l'indice d'intelligence d'Artificial Analysis, Grok 4.7 obtient 46 points, loin derrière Claude Fable 5.1 et GPT-6, à 53 chacun.

Comparatif

Modèle Entrée ($/M) Sortie ($/M) Contexte Version précédente
Claude Opus 5.5 4 20 1M Opus 5 : 5 / 25
GPT-6 Sol 2 10 1,05M GPT-5.6 Sol : 4 / 20
GPT-6 Luna 0,10 0,50 1,05M GPT-5.6 Luna : 0,20 / 1,20
Grok 4.7 2 6 500K Grok 4.6 : 2 / 6

La tendance

Les prix baissent. En deux mois, Anthropic retire 20 % sur Opus et OpenAI divise ses tarifs par deux. xAI garde son prix, mais livre un modèle 40 % plus gros.

Les fenêtres de contexte, elles, stagnent autour du million de tokens. Anthropic et OpenAI y étaient déjà en juillet. La bataille ne porte plus sur la taille de la mémoire. Elle porte sur le coût d'une tâche terminée.

Pour les entreprises, la conséquence est simple : un agent qui tournait sur Opus 5 en juillet coûte moins cher aujourd'hui, à performance égale ou supérieure. Pour une industrie qui voulait ralentir, la course aux prix continue à pleine vitesse.

Ma recommandation : quel modèle choisir ?

Vu la cadence de sortie, les tarifs en baisse et la concurrence chinoise toujours aussi rude, se marier à un LLM a de moins en moins de sens. On y gagne un sentiment de familiarité, un harness qui fonctionne out-of-the-box, mais l'engagement que ça demande me semble franchement compliqué à gérer.

Concrètement : un contrat unique devant le LLM (mêmes outils, même schéma de sortie, mêmes logs), un routeur qui envoie le volume sur le moins cher et le raisonnement sur le plus fiable (limite un Jev - mais attention à la confidentialité), et une batterie de tests métier pour savoir, en vingt minutes, si le remplaçant tient ses promesses. Dès qu'Opus baisse encore, que Luna devient assez bon, ou que Grok augmente son contexte, on bascule.

Le piège classique, c’est de coder contre une bizarrerie du moment : le palier de prix OpenAI au-delà de 272k tokens, le cache Anthropic, le demi-million de contexte chez xAI. Ces détails finiront par changer. Vu l'offre pléthorique, disqualifiez un modèle le plus vite possible et n'y revenez plus (jusqu'à sa prochaine mise à jour). Si votre agent dépend d'un labo, vous n’avez pas une stack solide.

Donc : un LLM interchangeable, plusieurs modèles selon la tâche, une mesure du coût réel par dossier traité. Oubliez la fidélité romantique à une marque. À cette vitesse, la seule décision durable, c’est de rester agile !

Didier Sampaolo
Didier Sampaolo

Fondateur / Directeur technique