Une intelligence artificielle de 27 milliards de paramètres peut-elle réellement prendre l’avantage sur les modèles les plus avancés d’OpenAI et Anthropic ?

C’est la question spectaculaire posée par Inherent, un laboratoire britannique d’intelligence artificielle encore peu connu en France.

Son premier agent scientifique, Faraday, vient d’obtenir des résultats remarqués sur une tâche très précise : reproduire des expériences décrites dans de véritables publications de recherche.

Dans la présentation technique de Faraday publiée par Inherent, le laboratoire affirme que son système surpasse Claude Opus 4.8 et GPT-5.5 sur son benchmark de réplication scientifique.

Mais réduire l’expérience à « une petite IA bat OpenAI » passerait à côté de l’essentiel.

Faraday utilise lui-même GPT-5.5 Codex comme outil.

Inherent ne montre donc pas simplement qu’un modèle relativement compact peut rivaliser avec un modèle frontier. Le laboratoire montre qu’un agent spécialisé peut apprendre à diriger une intelligence plus puissante pour accomplir une mission précise.

C’est une nuance fondamentale.

Et probablement la partie la plus intéressante du projet.

Inherent IA ne veut pas construire un nouveau chatbot

Inherent appartient à une nouvelle génération de laboratoires qui ne cherchent plus nécessairement à lancer leur propre équivalent de ChatGPT.

La société veut développer des AI Scientists, ou scientifiques IA.

L’objectif est de construire des agents capables de participer à une véritable démarche de recherche :

  • comprendre une publication ;
  • identifier un problème ;
  • choisir une hypothèse ;
  • décider quelles expériences mener ;
  • utiliser différents outils ;
  • analyser les résultats ;
  • modifier leur approche ;
  • poursuivre la recherche sur plusieurs étapes.

Cette logique rejoint directement le développement des agents IA autonomes capables de planifier et d’exécuter plusieurs actions.

Un chatbot attend généralement une question puis génère une réponse.

Un agent reçoit plutôt un objectif.

Il doit ensuite déterminer comment l’atteindre.

Dans le cas d’Inherent, cet objectif n’est ni commercial ni administratif : il est scientifique.

Faraday apprend à chercher, pas seulement à répondre

Faraday repose sur un modèle d’environ 27 milliards de paramètres, issu de Qwen3.6-27B puis spécialisé grâce à un post-entraînement par apprentissage par renforcement.

Cette taille reste relativement modeste face aux systèmes frontier.

Mais le nombre de paramètres n’est pas au cœur du projet.

Inherent cherche surtout à apprendre à Faraday une forme de jugement scientifique.

Un bon chercheur ne doit pas simplement connaître énormément de choses.

Il doit aussi savoir :

  • quelle expérience vaut la peine d’être menée ;
  • quelle hypothèse paraît crédible ;
  • quand une piste doit être abandonnée ;
  • comment interpréter un échec ;
  • quelles ressources consacrer à une expérience ;
  • quelle information manque pour avancer.

Inherent utilise l’expression research taste pour décrire cette capacité de discernement.

Autrement dit, Faraday est entraîné moins pour connaître toutes les réponses que pour prendre de meilleures décisions pendant la recherche d’une réponse.

Replica transforme 100 articles scientifiques en 310 expériences à reproduire

Pour entraîner cette capacité, Inherent a construit un environnement appelé Replica.

Le papier scientifique consacré à Faraday décrit une première collection de 310 tâches issues de 100 publications en machine learning et en AI-for-science.

Les travaux couvrent notamment :

  • le traitement automatique du langage ;
  • le machine learning ;
  • les sciences des matériaux ;
  • la biologie structurale ;
  • la météorologie.

Le principe est particulièrement pertinent.

Inherent retire d’une publication une figure contenant un résultat scientifique.

Faraday reçoit l’article sans cette figure et doit tenter de reproduire expérimentalement le résultat manquant.

L’agent ne peut donc pas simplement retrouver la réponse dans le document.

Il doit comprendre le problème, reconstruire une expérience et obtenir un résultat cohérent avec les conclusions de l’étude.

Les ressources sont volontairement limitées.

Chaque tâche dispose notamment d’un budget de calcul et d’une fenêtre de temps définie.

Faraday doit donc choisir.

Il ne peut pas tester indéfiniment toutes les pistes possibles.

Faraday dépasse Claude et GPT-5.5 sur le benchmark d’Inherent

C’est le résultat qui donne aujourd’hui de la visibilité à Inherent IA.

Selon les résultats publiés par le laboratoire, Faraday réalise des réplications plus performantes que les systèmes de référence utilisant :

  • Claude Opus 4.8 ;
  • GPT-5.5 Codex.

Inherent rapporte notamment que Faraday surpasse les systèmes comparés sur 73 % des tâches machine learning appartenant à la distribution d’entraînement.

Sur les tâches AI-for-science conservées pour l’évaluation, la proportion annoncée atteint 60 %.

Le laboratoire rapporte également, sur ce jeu de test, un avantage moyen d’environ :

+6 % face à Claude

et

+8 % face à Codex.

Ces chiffres sont suffisamment importants pour rendre le résultat intéressant.

Ils ne doivent toutefois pas être transformés en classement général.

Faraday n’a pas démontré qu’il était meilleur que Claude ou GPT-5.5 pour :

  • rédiger ;
  • coder généralement ;
  • analyser des documents ;
  • utiliser un ordinateur ;
  • effectuer des recherches ;
  • gérer une entreprise ;
  • résoudre n’importe quel problème complexe.

Il obtient de meilleurs résultats dans l’environnement Replica développé par Inherent pour une tâche définie de réplication scientifique.

Comme lorsqu’on compare Claude aux autres grands modèles d’intelligence artificielle, un benchmark mesure une capacité précise. Il ne désigne pas automatiquement la meilleure IA dans l’absolu.

Le détail le plus important : Faraday utilise GPT-5.5 Codex

C’est ici que le projet devient beaucoup plus intéressant qu’une simple bataille de benchmarks.

Faraday possède bien un modèle principal de 27 milliards de paramètres.

Mais lorsqu’il doit programmer une expérience, il peut utiliser GPT-5.5 Codex comme outil.

Le modèle d’Inherent joue alors davantage le rôle du chercheur principal.

Il peut :

  1. comprendre l’objectif ;
  2. choisir une expérience ;
  3. définir ce qui doit être programmé ;
  4. demander à Codex de réaliser cette partie ;
  5. analyser les résultats ;
  6. décider de la prochaine expérience.

Cette séparation entre supervision et exécution change profondément la lecture des résultats.

Faraday ne montre pas nécessairement qu’un modèle de 27 milliards de paramètres possède davantage de puissance brute que GPT-5.5.

Il suggère plutôt qu’un agent spécialisé peut apprendre à utiliser un modèle plus puissant de manière plus efficace pour résoudre un problème spécifique.

L’IA passe du modèle unique à l’architecture composée

Cette approche illustre une transformation plus générale de l’intelligence artificielle.

Pendant plusieurs années, la question centrale était :

Quel est le meilleur modèle ?

GPT, Claude, Gemini, Llama ou DeepSeek étaient principalement comparés comme des systèmes isolés.

Avec l’essor de l’IA agentique et de l’automatisation des workflows, cette logique devient progressivement insuffisante.

Un système IA moderne peut désormais associer :

  • un modèle spécialisé ;
  • un modèle frontier ;
  • un agent de programmation ;
  • un moteur de recherche ;
  • une mémoire ;
  • une base documentaire ;
  • un environnement d’exécution ;
  • un outil métier ;
  • un système de contrôle.

Le produit final n’est alors plus réellement un modèle.

Il devient une architecture capable de coordonner plusieurs formes d’intelligence.

Faraday constitue une illustration particulièrement claire de cette évolution.

Un petit modèle peut devenir le manager d’un modèle plus puissant

Le paradoxe est intéressant.

Faraday n’a pas besoin d’être meilleur développeur que Codex.

Il doit savoir quand utiliser Codex, pourquoi l’utiliser et quoi lui demander.

Cette différence ressemble davantage à une relation entre management et expertise technique.

Un directeur de laboratoire ne réalise pas personnellement chaque manipulation.

Il doit être capable de :

  • comprendre le problème ;
  • mobiliser le bon spécialiste ;
  • définir l’expérience ;
  • interpréter les résultats ;
  • décider de la prochaine étape.

Inherent tente de reproduire cette couche de décision dans un agent.

C’est probablement là que se situe la véritable innovation du projet.

Pourquoi reproduire des recherches déjà publiées ?

La réplication pourrait sembler être un objectif limité.

Après tout, Faraday ne découvre pas encore nécessairement quelque chose que les humains ignorent.

Mais une publication scientifique décrit surtout ce qui a finalement fonctionné.

Elle contient beaucoup moins :

  • les expériences ratées ;
  • les hypothèses abandonnées ;
  • les modifications de protocole ;
  • les essais intermédiaires ;
  • les décisions ayant permis d’arriver au résultat.

Pour reproduire une figure scientifique, l’agent doit reconstruire une partie de ce chemin invisible.

Il doit notamment déterminer quelles expériences sont réellement nécessaires.

Replica cherche donc moins à tester la capacité d’un modèle à mémoriser un article qu’à évaluer sa capacité à mener une démarche expérimentale sous contrainte.

C’est pourquoi Inherent présente la réplication comme une étape vers un objectif beaucoup plus ambitieux.

De la réplication à un véritable scientifique IA

La vision d’Inherent consiste à passer progressivement d’un agent capable de reproduire un résultat connu à un système capable de mener une recherche ouverte.

La boucle deviendrait alors :

question → hypothèse → expérience → résultat → analyse → nouvelle hypothèse

Certaines briques existent déjà.

Les modèles actuels savent notamment :

  • rechercher de la littérature ;
  • résumer des publications ;
  • générer du code ;
  • analyser certaines données ;
  • proposer des hypothèses ;
  • lancer des simulations.

Le problème consiste à relier ces capacités dans une boucle suffisamment fiable pour que l’agent puisse travailler pendant plusieurs heures ou plusieurs jours sans accumuler d’erreurs.

C’est précisément le type de problème auquel s’intéressent les architectures d’agents.

Les résultats d’Inherent restent à interpréter avec prudence

Faraday constitue un signal technologique intéressant.

Mais plusieurs limites doivent rester visibles.

Replica est développé par Inherent

Le laboratoire qui entraîne Faraday est également à l’origine du benchmark utilisé pour démontrer ses performances.

Cela n’invalide pas les résultats.

Mais une réplication indépendante apporterait évidemment davantage de poids à la démonstration.

L’évaluation est en partie automatisée

Inherent utilise un système de rubriques et un juge basé sur un modèle pour évaluer la qualité des reproductions.

Le laboratoire explique avoir effectué une étude humaine pour vérifier que cette évaluation automatisée reste cohérente avec le jugement d’experts.

La méthodologie est donc plus élaborée qu’un simple jugement automatique, mais elle reste un élément à surveiller.

Faraday dépend lui-même de Codex

L’affirmation selon laquelle « 27 milliards de paramètres battent GPT-5.5 » serait donc trompeuse.

Faraday exploite lui-même la puissance de GPT-5.5 Codex.

Répliquer n’est pas découvrir

Enfin, savoir reproduire une expérience existante ne démontre pas encore qu’un agent peut produire de manière fiable une véritable découverte scientifique.

C’est probablement la prochaine barrière qu’Inherent devra franchir.

Pourquoi Inherent pourrait compter bien au-delà de la science

Le cas Faraday contient également un enseignement important pour les entreprises.

Un système IA performant ne nécessite pas forcément que le modèle le plus cher réalise toutes les opérations.

Une architecture peut fonctionner ainsi :

agent spécialisé → modèle frontier → outil → résultat → contrôle

Le modèle coûteux n’est appelé que lorsqu’il possède réellement un avantage.

Cette approche peut potentiellement :

  • réduire les coûts ;
  • améliorer la spécialisation ;
  • faciliter le changement de fournisseur ;
  • isoler les différentes fonctions ;
  • ajouter davantage de contrôles ;
  • améliorer la fiabilité.

Cette évolution apparaît déjà dans le monde professionnel avec des startups qui construisent des agents IA spécialisés dans l’exécution de fonctions métier.

La recherche scientifique et le back-office d’une PME n’ont évidemment pas les mêmes contraintes.

Mais l’architecture fondamentale devient comparable.

Les grands modèles deviennent des infrastructures que des agents spécialisés apprennent à utiliser.

Une opportunité stratégique pour les nouvelles startups IA

Cette évolution pourrait modifier la manière de construire une entreprise dans l’intelligence artificielle.

Créer un nouveau modèle généraliste capable de concurrencer directement OpenAI, Anthropic ou Google nécessite désormais des ressources considérables.

À l’inverse, une startup peut chercher à développer un avantage autour :

  • d’une expertise métier ;
  • de données propriétaires ;
  • d’un modèle spécialisé ;
  • d’un benchmark spécifique ;
  • d’un environnement d’entraînement ;
  • d’outils propriétaires ;
  • d’un système d’évaluation ;
  • d’une architecture agentique.

Les modèles frontier deviennent alors une matière première technologique.

La différenciation se construit au-dessus.

Inherent applique précisément cette logique à la recherche scientifique.

Inherent IA montre peut-être où se déplace la valeur

Le résultat de Faraday est finalement intéressant pour une raison beaucoup plus importante que son classement face à Claude ou GPT-5.5.

Pendant la première phase de l’IA générative, la valeur s’est concentrée dans les modèles.

La prochaine pourrait déplacer une partie de cette valeur vers les systèmes capables de décider :

  • quel modèle appeler ;
  • quand l’appeler ;
  • quelles informations lui transmettre ;
  • quel outil utiliser ;
  • comment vérifier son travail ;
  • quelle action exécuter ensuite.

Dans cette économie, GPT ou Claude deviennent progressivement comparables à des infrastructures de calcul.

Le véritable produit se construit au-dessus.

Faraday reste un premier signal.

Ses performances doivent encore être confirmées indépendamment et Inherent devra démontrer que son agent peut passer de la réplication de résultats connus à une recherche réellement ouverte.

Mais le laboratoire vient déjà de rendre une idée beaucoup plus concrète :

la prochaine génération d’IA ne sera peut-être pas dominée uniquement par les plus gros modèles, mais par les systèmes qui sauront le mieux les orchestrer.