11 fois moins chère, 150 millions de paramètres, BDH-CQ évite de penser tout haut et surprend ChatGPT sur le raisonnement

Infos ITLES NEWS DU MARCHÉ11 fois moins chère, 150 millions de paramètres, BDH-CQ évite de penser...

Le laboratoire d’intelligence artificielle Pathway affirme avoir obtenu un résultat remarqué avec BDH-CQ, un modèle de 150 millions de paramètres conçu pour résoudre des tâches de raisonnement sans produire de longues étapes textuelles intermédiaires. D’après les données publiées, le système atteint 29,5% en pass@2 sur ARC-AGI-1, pour un coût calculé de 0,0007 dollar par tâche. Le score reste inférieur à celui du modèle Luna associé à ChatGPT, mais l’écart de prix replace le débat sur l’efficacité des architectures.

Pathway chiffre BDH-CQ à 0,0007 dollar par tâche

Pathway présente son modèle BDH-CQ comme une démonstration de sobriété informatique dans un marché dominé par des systèmes toujours plus volumineux. Avec 150 millions de paramètres, le modèle se situe très loin des grands modèles propriétaires habituellement mobilisés pour les tâches de raisonnement avancé. Cette taille réduite n’empêche pas le laboratoire de revendiquer une performance mesurable sur un banc d’essai public.

Le résultat communiqué porte sur ARC-AGI-1, une évaluation utilisée pour tester la capacité d’un système à identifier une règle à partir de quelques exemples, puis à l’appliquer à de nouvelles entrées. Pathway annonce 29,5% en pass@2, une métrique qui laisse deux tentatives au modèle pour produire une réponse correcte. Cette précision méthodologique compte, car elle évite de comparer directement ce chiffre avec des tests fondés sur un seul essai.

Le point le plus commenté concerne le coût. Pathway estime l’inférence à 0,0007 dollar par tâche, soit environ onze fois moins que le modèle GPT 5.6 Luna en version Low cité dans la comparaison. Cette donnée ne porte pas sur le prix d’un abonnement grand public, mais sur le coût calculé d’exécution d’une tâche de benchmark, niveau auquel les entreprises mesurent leurs dépenses réelles.

La directrice générale et cofondatrice de Pathway, Zuzanna Stamirowska, résume l’argument du laboratoire en soulignant que le prix du raisonnement dépend fortement de l’architecture. L’idée défendue est simple, le coût élevé ne provient pas uniquement de la difficulté des problèmes, mais de la manière dont les modèles organisent leurs calculs. Le message vise directement les acteurs qui multiplient les modèles géants pour gagner quelques points de performance.

Comparaison des coûts d’inférence IA dans un centre de données moderne
Le coût par tâche devient un critère central pour les entreprises utilisant l’IA à grande échelle. — Photo : Lee chinyama / Pexels

ARC-AGI-1 place Luna devant BDH-CQ, mais plus cher

La comparaison publiée ne place pas BDH-CQ en tête du classement brut. Le modèle Luna associé à ChatGPT atteint 34,2% sur ARC-AGI-1, contre 29,5% pour Pathway. L’écart existe, mais il reste limité dans le contexte d’un coût beaucoup plus élevé. D’après les chiffres rapportés, Luna revient à 0,008 dollar par tâche, malgré une baisse tarifaire récente appliquée par OpenAI le 30 juillet 2026.

Cette différence nourrit un débat déjà central chez les entreprises qui utilisent l’IA par API. Un modèle légèrement plus précis peut devenir moins attractif si son coût d’exécution freine le passage à grande échelle. Pour un prototype interne, quelques centimes paraissent négligeables. Pour un service traitant plusieurs millions de demandes, l’écart modifie le budget, les marges et parfois la décision de déployer ou non une fonctionnalité.

Les modèles de pointe restent largement supérieurs sur la performance pure. Claude Opus 5 et Gemini 3.1 Pro sont crédités de scores autour de 97% à 98%, selon le tableau cité, mais avec des coûts proches de 0,5 à 0,6 dollar par tâche. Le niveau atteint par ces systèmes confirme leur avance technique, tout en rappelant que la meilleure précision disponible impose un prix d’inférence nettement plus lourd.

Le cas de Qwen3 235B, mentionné dans la comparaison, illustre une autre limite du seul critère de taille. Ce modèle coûterait plus de trois fois le prix de BDH-CQ tout en obtenant un score moins favorable que sa variante Low dans ce contexte précis. La lecture prudente s’impose, car un benchmark ne couvre pas tous les usages. Mais pour le raisonnement abstrait mesuré par ARC-AGI-1, Pathway marque un point sur le rapport performance-prix.

Chercheur IA illustrant un raisonnement interne sans texte intermédiaire visible
BDH-CQ mise sur un raisonnement interne afin de limiter la génération de jetons. — Photo : Vanessa Garcia / Pexels

BDH-CQ réduit les jetons en raisonnant dans sa mémoire

La différence technique mise en avant repose sur la manière de raisonner pendant l’inférence. De nombreux modèles produisent des chaînes de pensée, c’est-à-dire des étapes intermédiaires formulées en langage naturel avant la réponse. Cette méthode peut améliorer certaines performances, mais elle augmente le nombre de jetons générés. Or les jetons constituent l’unité économique de nombreux services d’IA, avec un impact direct sur la facture.

BDH-CQ adopte une approche distincte. Selon Pathway, le modèle traite le problème dans sa mémoire interne plutôt que de dérouler longuement ses calculs sous forme de texte visible. Cette conception vise à réduire les sorties inutiles, à limiter le temps de réponse et à concentrer la dépense de calcul sur la résolution elle-même. Le laboratoire décrit cette piste comme une alternative aux architectures centrées sur la génération séquentielle de texte.

Le sujet dépasse la seule optimisation tarifaire. Les chaînes de pensée visibles posent aussi des questions de confidentialité, de robustesse et d’interprétation. Elles peuvent exposer des raisonnements partiels, parfois erronés, que l’utilisateur lit comme une justification fiable. Un système qui raisonne sans tout verbaliser peut éviter une partie de cette inflation textuelle. Néanmoins, il devient plus difficile d’auditer précisément le chemin suivi par le modèle.

La notion d’inférence efficace devient stratégique depuis que les usages professionnels s’étendent aux agents, à l’analyse documentaire, au support client et à l’aide au développement logiciel. Dans ces scénarios, la latence compte autant que le score académique. Un modèle compact capable de résoudre certaines tâches avec moins de calcul peut être combiné à des systèmes plus puissants, réservés aux cas où la complexité justifie une dépense supérieure.

AWS voit un intérêt industriel pour l’inférence moins coûteuse

Amazon Web Services suit ce type de résultat avec attention, car l’adoption de l’IA générative dépend aussi des coûts d’exploitation. AWS cite la performance de BDH-CQ comme une avancée prometteuse pour rapprocher le raisonnement avancé des produits réels. Nicolas Tarducci, représentant du groupe, insiste sur trois critères recherchés par les clients, performance, efficacité et capacité à monter en charge.

La remarque de Nicolas Tarducci correspond aux préoccupations observées dans les directions techniques. Les expérimentations menées avec des modèles très puissants produisent souvent des démonstrations convaincantes, mais leur transformation en service stable exige une autre discipline. Il faut prévoir les pics de demande, mesurer le coût moyen par requête, contrôler les délais de réponse et assurer une qualité constante sur des volumes élevés.

Pour la production, un modèle plus petit peut trouver sa place dans une architecture hybride. Une entreprise peut confier les tâches simples ou répétitives à un modèle peu coûteux, puis router les cas difficiles vers un modèle de pointe. Cette logique existe déjà dans certains systèmes de recherche, de tri de tickets ou d’assistants internes. BDH-CQ apporte un nouvel exemple de cette segmentation, appliquée au raisonnement.

La scalabilité reste le terrain sur lequel Pathway devra convaincre au-delà du benchmark. ARC-AGI-1 mesure une forme précise d’abstraction, pas la totalité des compétences attendues d’un assistant d’entreprise. Les prochains essais devront documenter la stabilité sur d’autres jeux de données, les performances en contexte long et la résistance aux consignes ambiguës. Les résultats actuels suffisent à relancer une question centrale, celle du meilleur compromis entre architecture, coût et intelligence utile.

Questions fréquentes

Que mesure le benchmark ARC-AGI-1 ?
ARC-AGI-1 évalue la capacité d’un système d’IA à déduire une règle à partir d’exemples limités, puis à l’appliquer à de nouveaux cas. Il mesure une forme de raisonnement abstrait, mais il ne couvre pas tous les usages professionnels.
BDH-CQ est-il plus performant que ChatGPT ?
Sur les chiffres cités, BDH-CQ obtient 29,5% en pass@2, contre 34,2% pour Luna, le modèle associé à ChatGPT dans cette comparaison. Son avantage porte surtout sur le coût calculé par tâche.
Pourquoi l’absence de chaînes de pensée visibles réduit-elle les coûts ?
Les longues étapes textuelles intermédiaires augmentent le nombre de jetons générés. Comme les jetons pèsent dans le coût d’inférence, un raisonnement mené davantage en mémoire interne peut réduire la facture et la latence.

À retenir

  • BDH-CQ atteint 29,5% sur ARC-AGI-1 avec 150 millions de paramètres.
  • Pathway estime le coût d’inférence à 0,0007 dollar par tâche.
  • Luna obtient un score supérieur, mais avec un coût nettement plus élevé.
  • Le modèle réduit les jetons en évitant les longues chaînes de pensée visibles.
  • AWS voit un intérêt pour les déploiements industriels plus abordables.
Rédacteur chez Journal Infos It
Marcel Tricotte s'intéresse de près aux innovations numériques, aux technologies du web et aux solutions qui transforment les usages digitaux. Il partage une veille régulière sur les logiciels, les plateformes, les services en ligne et les évolutions du secteur. Pour renforcer la qualité de ses contenus, il s'appuie sur l'intelligence artificielle, tout en assurant une vérification et une validation éditoriales avant chaque publication.
Marcel tricotte
spot_imgspot_img

Actualités

spot_img