Intelligence Artificielle

Grok 4 : xAI lance le modèle d'IA le plus puissant du monde selon les benchmarks

Grok 4 : xAI lance le modèle d'IA le plus puissant du monde selon les benchmarks

C’est le genre d’annonce qui fait trembler tout l’écosystème de l’intelligence artificielle. xAI, la startup d’Elon Musk, vient de lancer Grok 4 — et selon les benchmarks, il s’agit tout simplement du modèle d’IA le plus performant jamais créé. Grok 4 est disponible dès maintenant pour les abonnés SuperGrok et Premium+, ainsi que via l’API xAI.

Mais la vraie bombe, c’est Grok 4 Heavy — la version la plus puissante, réservée à un nouveau tier d’abonnement baptisé SuperGrok Heavy. Ce modèle vient de réaliser ce qu’aucun autre système d’IA n’avait accompli : dépasser les 50% sur Humanity’s Last Exam, le benchmark conçu pour être “le dernier test académique fermé de son type.”

Qu’est-ce que Humanity’s Last Exam ?

Avant de plonger dans les performances de Grok 4, il faut comprendre pourquoi Humanity’s Last Exam (HLE) est considéré comme la référence ultime dans le monde des benchmarks IA.

HLE a été conçu par des centaines d’experts académiques du monde entier avec un objectif précis : créer un ensemble de questions auxquelles les modèles d’IA actuels ne peuvent tout simplement pas répondre. Il couvre des domaines comme les mathématiques avancées, la physique théorique, la biochimie, la philosophie, le droit international — des disciplines où l’expertise humaine de pointe est irremplaçable.

Les résultats des meilleurs modèles avant Grok 4 :

  • GPT-5.5 (OpenAI) : ~40%
  • Claude Opus 4.8 (Anthropic) : ~42%
  • Gemini 3.5 Pro (Google) : ~44%
  • Grok 4 Heavy (xAI) : 50,7%

Un score de 50% sur un benchmark qui a été conçu pour être quasi-impossible est un saut qualitatif majeur. C’est la première fois qu’un modèle franchit cette barre symbolique.

Les performances de Grok 4 sur les autres benchmarks

Grok 4 ne se contente pas de dominer HLE. Sur pratiquement tous les benchmarks importants, le modèle d’xAI s’impose au sommet :

ARC-AGI V2

ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) est peut-être le test le plus révélateur des capacités de raisonnement abstrait d’un système d’IA. Grok 4 établit un nouveau record avec 15,9% — soit presque le double du score d’Anthropic’s Opus (~8,6%) et une amélioration de 8 points de pourcentage par rapport au précédent record.

Ces chiffres peuvent sembler modestes en valeur absolue, mais dans le contexte d’ARC-AGI — conçu pour mesurer ce que le fondateur de la compétition, François Chollet, appelle le “raisonnement de sens commun” — c’est une performance remarquable.

USAMO 2025 (Olympiades Mathématiques Américaines)

Sur les problèmes des olympiades de mathématiques américaines 2025, Grok 4 Heavy atteint 61,9% — un score qui placerait le modèle parmi les meilleurs candidats humains à cette compétition d’élite.

Vending-Bench (performance agentique)

Ce benchmark mesure les capacités des agents IA dans des tâches économiques complexes — gérer un commerce virtuel, prendre des décisions d’inventaire, optimiser les profits sur la durée. Les résultats sont saisissants :

AgentValeur nette moyenneUnités vendues
Grok 4 Heavy$4 6944 569
Claude Opus 4$2 0771 412
Humains$844344

Grok 4 Heavy ne se contente pas de battre les autres modèles — il bat aussi les humains dans cet environnement, et avec une marge considérable.

Les innovations techniques derrière Grok 4

Outils natifs et recherche en temps réel

Contrairement à de nombreux modèles qui ont été adaptés après-coup pour utiliser des outils externes, Grok 4 a été entraîné nativement pour utiliser des outils grâce au reinforcement learning. Cette approche fondamentalement différente lui permet d’intégrer seamlessly :

  • Interpréteur de code : pour vérifier ses raisonnements mathématiques et logiques par l’expérimentation
  • Navigation web en temps réel : Grok 4 choisit ses propres requêtes de recherche, explore le web aussi profondément que nécessaire, et synthétise les informations en réponses de haute qualité
  • Recherche avancée sur X : accès à la plateforme d’Elon Musk avec des outils de recherche sémantique et par mots-clés, y compris l’analyse de médias (images, vidéos)

Cette capacité à utiliser des outils en cours de raisonnement — plutôt que comme add-ons — représente une avancée architecturale significative.

Parallel Test-Time Compute (Grok 4 Heavy)

Grok 4 Heavy introduit le concept de calcul parallèle au temps d’inférence — la capacité du modèle à considérer plusieurs hypothèses simultanément pendant qu’il génère une réponse.

En termes simples : au lieu de raisonner de manière linéaire (A → B → C → réponse), Grok 4 Heavy peut explorer plusieurs chemins de raisonnement en parallèle, comparer les résultats, et choisir la meilleure conclusion. C’est proche de la façon dont les humains experts abordent des problèmes complexes — en explorant mentalement plusieurs approches avant de s’engager sur une.

Disponibilité et tarification

Grok 4 (version standard) est disponible pour :

  • Abonnés SuperGrok (existants)
  • Abonnés Premium+ sur X
  • Via l’API xAI pour les développeurs

Grok 4 Heavy est réservé au nouveau tier SuperGrok Heavy, dont xAI n’a pas encore communiqué le prix officiel au moment de la publication.

Pour les développeurs, l’accès via l’API xAI permet d’intégrer Grok 4 dans des applications tierces — une opportunité que beaucoup d’équipes tech attendent avec impatience, notamment pour des cas d’usage en raisonnement avancé, recherche autonome et agents spécialisés.

xAI dans le paysage compétitif de l’IA

Il y a moins de deux ans, xAI était perçue par beaucoup comme un outsider — une startup lancée par Elon Musk plus par opportunisme que par nécessité technique. Avec Grok 4, cette perception doit radicalement changer.

La startup, qui opère en étroite synergie avec X (ex-Twitter) et bénéficie de l’accès aux données temps réel de la plateforme sociale la plus dynamique du monde, a clairement comblé son retard et dépassé ses concurrents sur les métriques les plus difficiles.

Ce que Grok 4 change dans la guerre des modèles :

  1. La pression sur OpenAI : GPT-5.5 était jusqu’ici considéré comme la référence. Grok 4 lui vole la couronne sur plusieurs benchmarks critiques. OpenAI devra accélérer le lancement de GPT-6 ou de nouvelles itérations pour reprendre le leadership.

  2. Anthropic en position délicate : déjà fragilisée par la suspension de Fable 5 et Mythos 5 suite à un ordre gouvernemental américain (voir notre article sur l’affaire Fable 5/Mythos 5), Anthropic voit maintenant son modèle phare Claude Opus 4.8 distancé sur les benchmarks de raisonnement.

  3. Google DeepMind sous surveillance : Gemini 3.5 Pro, lancé lors de Google I/O en mai, était attendu comme le modèle de référence pour les agents. Grok 4 challenge directement cette position, notamment sur les tâches agentiques (Vending-Bench).

  4. L’intégration X/Grok comme avantage unique : aucun autre modèle n’a accès aux données temps réel d’un réseau social de l’ampleur de X. Cette intégration native donne à Grok 4 un avantage sur les questions d’actualité, de tendances et d’analyse de sentiment en temps réel.

Les critiques et les limites

Malgré ces performances impressionnantes, plusieurs voix dans la communauté IA appellent à la prudence.

La question des benchmarks : les scores sur les benchmarks ne reflètent pas toujours les performances réelles dans les usages quotidiens. Des modèles optimisés pour certains tests peuvent sous-performer sur des tâches pratiques. Les utilisateurs auront besoin de temps pour évaluer Grok 4 dans des conditions réelles.

La transparence limitée : xAI est moins transparente sur ses architectures et méthodes d’entraînement qu’Anthropic ou DeepMind. Les claims de performance sont difficiles à vérifier de manière indépendante sans accès aux détails techniques.

Le coût d’utilisation : Grok 4 Heavy, derrière un nouveau tier d’abonnement premium, risque d’être inaccessible aux développeurs indépendants et aux petites entreprises — contrairement à certains modèles open-source qui offrent des capacités croissantes à coût réduit.

L’écosystème limité : malgré une API disponible, l’écosystème de plugins, d’intégrations et d’outils tiers autour de Grok reste beaucoup moins riche que celui construit autour de GPT ou Claude.

Ce qu’il faut retenir

  • Grok 4 d’xAI (Elon Musk) se positionne comme le modèle d’IA le plus puissant du monde selon les benchmarks actuels
  • Grok 4 Heavy est le premier modèle à dépasser 50% sur Humanity’s Last Exam (50,7%)
  • Record sur ARC-AGI V2 avec 15,9% — presque le double d’Anthropic Opus
  • USAMO 2025 : 61,9%, niveau des meilleurs candidats humains
  • Entraîné nativement pour utiliser des outils (code, web search, X search)
  • Disponible pour abonnés SuperGrok/Premium+ et via l’API xAI ; Grok 4 Heavy dans un nouveau tier SuperGrok Heavy
  • Met sous pression OpenAI, Anthropic et Google DeepMind pour accélérer leurs prochaines générations

La guerre des modèles entre dans une nouvelle phase. Et pour l’instant, c’est Elon Musk — via xAI — qui tient le flambeau.

Partager

Articles similaires