27 milliards de paramètres face aux modèles frontier
Inherent Laboratories a présenté Faraday le 14 août. L'entreprise londonienne, fondée notamment par d'anciens chercheurs de Google DeepMind, décrit son système comme un « AI Scientist » de 27 milliards de paramètres.
Sur Replica, le benchmark développé parallèlement par l'équipe, Faraday obtient de meilleurs résultats que Claude Opus 4.8 et GPT-5.5 sur les tâches de reproduction scientifique testées.
Le résultat est notable parce que les deux modèles utilisés comme références appartiennent à une catégorie beaucoup plus importante. Mais il faut immédiatement poser la limite : Faraday ne démontre pas qu'un modèle de 27B est globalement meilleur que Claude ou GPT.
Il démontre qu'un système beaucoup plus spécialisé peut dépasser des modèles généralistes sur un problème pour lequel il a précisément été entraîné.
Replica ne lui demande pas de réciter un article
Replica contient 310 tâches construites à partir de 100 articles de machine learning et d'AI for Science. Les domaines couverts vont notamment du traitement du langage naturel aux matériaux et à la prévision météorologique.
Le principe est plutôt malin. Une figure ou un résultat est retiré d'un article scientifique et l'agent doit essayer de le reconstruire à partir des informations restantes, sans voir le graphique original et avec des limites de temps et de calcul.
Il ne suffit donc pas de retrouver une phrase quelque part dans les données d'entraînement. L'agent doit interpréter la méthodologie, écrire ou faire écrire du code, lancer des expériences, observer les résultats puis décider de la suite.
Inherent cherche précisément à mesurer ce qu'elle appelle le « research taste » : la capacité à choisir une expérience utile plutôt qu'à simplement produire une réponse plausible.
Faraday n'est pas réellement seul
C'est ici que le résultat devient beaucoup plus intéressant techniquement. Faraday utilise des agents de programmation comme outils. Lors de l'évaluation présentée par Inherent, il peut notamment piloter GPT-5.5 Codex.
Autrement dit, le modèle de 27 milliards de paramètres n'effectue pas nécessairement lui-même tout le travail de programmation. Il peut décider de ce qu'il faut essayer, déléguer l'implémentation à un agent de code beaucoup plus puissant, examiner ce qui revient puis décider de l'étape suivante.
Faraday devient alors moins comparable à un développeur isolé qu'à un chercheur qui disposerait d'un excellent assistant de programmation.
Inherent explique même avoir entraîné Faraday avec GPT-5.4-mini comme outil avant de lui fournir GPT-5.5 Codex lors des tests. Selon l'équipe, le modèle a réussi à exploiter le nouvel agent plus performant sans devoir être réentraîné spécifiquement pour lui.
Le cerveau du système n'a pas forcément besoin d'être le plus gros
Cette séparation des rôles change complètement la lecture du résultat. Dans beaucoup de systèmes actuels, le modèle le plus puissant reçoit à la fois le contexte, le problème, les outils et la responsabilité de décider quoi faire.
Faraday explore une autre architecture. Une couche spécialisée relativement compacte conserve la responsabilité de la stratégie tandis que des modèles ou outils plus lourds interviennent uniquement lorsqu'une tâche précise l'exige.
Le gain potentiel ne se résume donc pas au nombre de paramètres. Un modèle spécialisé peut développer des comportements adaptés à une tâche particulière : savoir quand lancer une expérience, quand arrêter une piste, comment interpréter un résultat ou à quel moment appeler un autre outil.
C'est une distinction importante. Un modèle généraliste dispose d'un immense éventail de capacités. Il n'est pas automatiquement optimisé pour orchestrer pendant une heure une suite cohérente d'expériences scientifiques.
L'entraînement porte sur les décisions, pas seulement sur les réponses
Inherent entraîne Faraday avec du reinforcement learning à long horizon. Plutôt que de récompenser uniquement une réponse finale, l'équipe cherche à évaluer la qualité du processus suivi pendant une réplication.
Pour y parvenir, elle construit des grilles d'évaluation spécifiques à chaque tâche et utilise un juge basé sur un LLM. Inherent ajoute également plusieurs évaluations d'une même trajectoire et un mécanisme d'attribution du crédit aux différentes étapes.
L'objectif est de déterminer quelles décisions intermédiaires ont réellement contribué au résultat. Pour un agent qui enchaîne de nombreuses actions, c'est un problème beaucoup plus compliqué que de simplement noter une réponse finale comme correcte ou incorrecte.
Un benchmark maison reste un benchmark maison
Le résultat doit néanmoins être considéré avec prudence. Replica a été conçu par Inherent et Faraday a été entraîné précisément autour de cette famille de tâches.
L'étude publiée sur arXiv est un préprint. Les résultats ne constituent donc ni une validation indépendante de Faraday ni la preuve qu'il serait supérieur aux modèles concurrents pour la recherche scientifique en général.
Même le système d'évaluation utilise des modèles de langage et des rubriques automatisées. Inherent indique avoir comparé son juge à des évaluateurs humains pour vérifier sa cohérence, mais cela ne supprime pas les limites inhérentes à ce type de mesure.
La bonne conclusion n'est donc pas « un 27B vient de rendre inutiles les gros modèles ». Elle est beaucoup plus intéressante : une spécialisation suffisante peut changer la façon dont la puissance de ces gros modèles est utilisée.
Le modèle spécialisé pourrait devenir le chef d'orchestre
Faraday donne ainsi une idée assez concrète d'une architecture qui pourrait devenir fréquente. Au lieu d'envoyer chaque problème à un gigantesque modèle universel, un système peut conserver une couche plus petite spécialisée dans un domaine et n'appeler les modèles lourds que pour les opérations où ils apportent réellement quelque chose.
Pour la recherche, cette couche apprend à choisir les expériences. Pour le développement logiciel, elle pourrait comprendre l'architecture d'un projet et déléguer uniquement certaines modifications. Dans d'autres domaines, elle pourrait servir de contrôleur spécialisé autour d'outils beaucoup plus généraux.
Cela ne signifie pas nécessairement moins de calcul à chaque étape : Faraday utilise lui-même Codex. En revanche, cela change l'endroit où se trouve l'intelligence décisionnelle du système.
Et c'est probablement là que l'expérience d'Inherent devient plus importante que son score. Le prochain progrès des agents IA ne viendra peut-être pas uniquement d'un modèle toujours plus énorme. Il pourrait aussi venir d'un petit modèle qui sait beaucoup mieux lequel appeler, quand l'appeler et quoi lui demander.