The bitter lesson for robotics, AIs complete week-long programming tasks; and OpenAI's accidental AI hacker

Article Image
Bienvenue sur Import AI, une newsletter sur la recherche en IA. Import AI fonctionne sur arXiv, les cappuccinos et les commentaires des lecteurs. Si vous souhaitez soutenir cela, veuillez vous abonner.

Epoch et METR publient MirrorCode, une référence pour voir dans quelle mesure les systèmes d'IA peuvent effectuer des tâches de programmation à long terme :
…Les systèmes d’IA ne peuvent pas encore résoudre les tâches les plus difficiles (bien !)…
Epoch et METR ont publié MirrorCode, une référence destinée à voir dans quelle mesure les systèmes d'IA peuvent effectuer des tâches qui prennent beaucoup de temps aux humains. Le benchmark a été annoncé pour la première fois en avril (Import AI #453) et a maintenant été étoffé et publié avec des tests supplémentaires. Les résultats sont déjà très frappants ; Opus 4.7 a résolu une tâche en 14 heures pour un coût d'inférence de 251 $, ce qui, selon METR et Epoch, prendrait 2 à 17 semaines à un humain. "Nous avons également constaté que les modèles d'IA s'améliorent rapidement au fil du temps. Les modèles phares d'il y a un an auraient obtenu un score d'environ 30 % et se limitaient à des programmes plus simples, tels qu'un utilitaire de calendrier."

Qu'est-ce que MirrorCode : MirrorCode voit dans quelle mesure les systèmes d'IA peuvent réimplémenter un programme logiciel basé uniquement sur l'accès CLI. "Sans accès au code source du programme original ou au Web, une réimplémentation complète nécessite de concevoir une structure pour l'ensemble du programme, plutôt que de simplement traduire le code morceau par morceau."
Exemples de programmes : pkl (un langage de configuration programmable développé par Apple ; 61 000 lignes de code au total) ; gotree, un programme pour analyser et manipuler des arbres phylogénétiques (16 000 lignes de code) ; et qsv_select, un programme pour sélectionner et réorganiser les colonnes de données CSV (87 000 lignes de code).

Résultats : MirrorCode est un benchmark maniable mais difficile, bien que peut-être un peu trop simple. "Sur l'ensemble des 25 programmes cibles, 17 sur 25 ont eu au moins une exécution avec un score parfait. Quatre autres cibles ont eu une exécution presque parfaite avec un score de plus de 99 %. Les modèles d'IA ont réimplémenté avec succès de grands programmes cibles", écrivent les auteurs. "Claude Opus 4.7 et GPT-5.5 ont réimplémenté avec succès gotree dans plusieurs langages de programmation différents, pour un coût de 100 à 400 $. Des programmes encore plus volumineux que gotree ont été réimplémentés avec succès : par exemple Opus 4.7 a réimplémenté pkl".
Malgré son succès, MirrorCode a encore quelques points difficiles : « Dans nos résultats, 8 programmes cibles sur 25 n'ont jamais été résolus à un seuil de 100 %, et 4 sur 25 n'ont jamais été résolus à un seuil de 99 % », écrivent-ils. « La cible sur laquelle l'IA a le plus eu du mal était ruff, un linter et formateur Python… « L'IA a également eu particulièrement du mal sur le package mathématique, giac_subset, et la bibliothèque d'authentification de courrier électronique, mailauth ».

Détails de la version : MirrorCode se compose d'un échafaudage et de 22 des 25 programmes cibles MirrorCode (totalisant 132 instances de tâches dans six langues).

Pourquoi est-ce important ? Les systèmes d'IA peuvent s'auto-orienter : une façon de considérer ce benchmark est qu'il nous indique comment les systèmes d'IA se sont beaucoup améliorés en matière de codage, et c'est bien sûr vrai. Mais l’autre façon de voir les choses – et je suppose que c’est la plus importante – est que les systèmes d’IA peuvent s’auto-orienter par rapport à leur environnement ; ici, leur environnement est un logiciel extraterrestre et uniquement grâce à l'accès entrée-sortie à celui-ci, ils sont capables d'écrire à partir de zéro leur propre implémentation. Cela suggère que des agents d’IA très intelligents pourraient être capables d’apprendre du monde de telle manière qu’ils puissent récapituler les choses avec lesquelles ils interagissent comme des capacités développées en interne, leur permettant ainsi d’amorcer leur propre forme de civilisation industrielle simplement en ayant accès à la nôtre par une boîte noire.
Lire la suite : MirrorCode : Quel est le plus grand projet logiciel que l’IA peut réaliser seule ? (Époque AI).
Obtenez le code pour MirrorCode ici (Epoch Research, MirrorCode).

***

DOUBLE FONCTION : l'amère leçon et la robotique :

Anthropic model autonomously completes robot tasks 20X faster than a previous human record:
…Better robots through better models…
Anthropic has demonstrated how increasingly powerful general-purpose models might be able to meaningfully improve the capabilities of real world robots. Specifically, the company has shown how merely by scaling up its general purpose Opus line of models it was able to drastically improve robot capabilities.

What they did exactly:

August 2025: Anthropic tries to see how well its AI systems could accelerate humans at getting a quadruped robot to do intelligent things. The model (Claude Opus 4.1) is completely unable to do the tasks. Humans working with the models are about twice as effective as those without access to the model - though completing the whole set of tasks takes them 181 minutes.

May 2026: Opus 4.7 acting autonomously completes all the tasks but one in 9 minutes (and 35 seconds). (Claude was not able to effectively re-position a ball it had hit back into its starting position; a task humans had also struggled with). “With more time and additional scaffolding, we think it is very likely that current generations of Claude could do the same”.

Pourquoi est-ce important ? Des modèles plus intelligents pourraient débloquer des robots : la plupart des robots en dehors des environnements industriels sont limités dans leur adoption en raison de leur fragilité et de leur manque de généralisation ; Des recherches comme celle-ci montrent qu'à mesure que nous améliorons les capacités des modèles propriétaires standards à grande échelle, nous pourrions voir des avantages continus pour la robotique comme un dividende naturel d'une intelligence accrue. "Ces progrès ne sont pas le résultat d'un effort concerté pour améliorer les capacités robotiques de nos modèles", écrit Anthropic. "Ces améliorations, comme tant d'autres dans l'histoire du développement du LLM, sont le résultat d'une mise à l'échelle beaucoup plus générale."
Lire la suite : Project Fetch : Phase Deux (blog Anthropic).

Le secret du dimanche pour de meilleurs robots ? Entraînez un très gros modèle :
…L’amère leçon fonctionne aussi en robotique…
La start-up de robots IA Sunday a déclaré que le meilleur moyen de résoudre la généralisation des robots était d'associer un modèle pré-entraîné sous-jacent plus large à la collecte de petites quantités de données de haute qualité sur lesquelles ajuster le modèle.
"Nous avons trouvé une recette générale pour résoudre : un pré-entraînement à l'échelle, puis une montée en pente avec un minimum de données internes", écrit la startup, dans un article discutant de son nouveau modèle, ACT-2. La principale conclusion du déploiement d'ACT-2 "est que les gains de fiabilité résultant d'itérations post-formation rapides sur des mémos internes se généralisent à des environnements domestiques réels et invisibles. La clé est de combler l'écart de généralisation grâce à un modèle de base solide".

Tout est question de pré-formation : « À mesure que le modèle pré-entraîné devient plus solide, les gains tirés d’une petite quantité de données internes deviennent de plus en plus transférables plutôt que de rester liés aux environnements dans lesquels ces données ont été collectées », écrivent-ils. "L'écart restant en termes de fiabilité et de performances au niveau du déploiement provient de cas extrêmes difficiles et d'échecs qui n'apparaissent qu'après l'exécution répétée de la politique dans le monde réel. La même capacité de généralisation qui permet à notre modèle d'apprendre de nouveaux comportements à partir d'une seule démonstration permet également à notre modèle d'apprendre efficacement des récupérations. Notre boucle post-formation cible directement ces lacunes. "

Succès décent : les robots atteignent un taux de réussite de 99,1 %, effectuant 778 plis réussis sur 9 types de vêtements. Les vêtements simples comme les shorts et les t-shirts ont tendance à être les plus faciles pour eux, tandis que les vêtements plus compliqués comme les chemisiers ont tendance à être plus difficiles (même s'ils enregistrent toujours des taux de réussite supérieurs à 90 %). «Cet automne, nous déploierons Memo auprès des familles via notre programme bêta», écrivent-ils.

Pourquoi est-ce important ? Si nous résolvons la généralisation, attendez-vous à ce que la robotique décolle : le domaine des startups de robots est construit sur les os de startups de robots mortes qui elles-mêmes reposent sur les os d'efforts de robots universitaires morts. Les robots sont difficiles. Les robots industriels ont connu du succès parce qu’ils fonctionnent dans des environnements restreints et scriptés où il n’est pas nécessaire de généraliser en dehors d’un domaine restreint. En revanche, les robots conçus pour la maison n’ont réussi que lorsqu’ils ont réussi à limiter à la fois la tâche et le facteur de forme (par exemple, les robots aspirateurs). Ce que font les startups comme Sunday est bien plus difficile : elles essaient de construire des systèmes à usage 🇺🇸 général qui peuvent effectuer un large éventail de tâches dans la maison (ou dans les petites entreprises), y compris des tâches génériques de rangement et de rangement (d'autres exemples incluent l'intelligence physique, Import AI #447). Cela nécessite une énorme quantité d’intelligence car cela nécessite une généralisation importante. Si dimanche est le bon moment, alors le domaine de la formation des modèles de base des robots pourrait avoir suffisamment mûri pour que nous commencions à créer des systèmes suffisamment intelligents pour résoudre ces défis de généralisation. Si tel est le cas, nous pourrions bientôt assister à des progrès (et à une diffusion) plus rapides des systèmes robotiques. C’est également le genre de chose à laquelle on s’attendrait en route vers des systèmes capables d’auto-amélioration récursive.

"L'un des aspects les plus frappants d'ACT-2 a été la fréquence à laquelle le modèle nous surprend", écrivent les auteurs. "Le même modèle de base apprend déjà un ensemble plus large de capacités domestiques, notamment passer l'aspirateur, organiser les jouets, fermer les fermetures éclair, retourner les pantalons et préparer le café."
Lire la suite : Aperçu ACT-2 : Généraliser la fiabilité (robotique du dimanche). Toutes les vidéos sont ici (dimanche, YouTube).

***

DOUBLE FONCTION : piratage OpenAI
Un modèle OpenAI pirate à la fois OpenAI et HuggingFace :
…Moins d’un coup de semonce et plus d’un kaboom d’avertissement…
Deux modèles OpenAI – GPT-5.6 Sol et un « modèle préliminaire encore plus performant », tous deux avec des cyber-refus réduits – ont récemment piraté OpenAI et HuggingFace. Pour ce faire, les modèles « ont identifié et enchaîné les vulnérabilités dans l’environnement de recherche d’OpenAI et l’infrastructure de production de HuggingFace pour obtenir des solutions de test directement à partir de la base de données de production de HuggingFace », explique OpenAI. "Toutes les preuves suggèrent que les modèles étaient hyper concentrés sur la recherche d'une solution pour ExploitGym, faisant des efforts extrêmes pour atteindre un objectif de test plutôt restreint."

Plus de détails sur le hack : le modèle a dépensé beaucoup de calculs d'inférence en interne chez OpenAI pour trouver un moyen de sortir de son conteneur afin d'obtenir plus d'informations à utiliser pour résoudre son problème. "Après avoir accédé à Internet, les modèles ont déduit que HuggingFace hébergeait potentiellement des modèles, des ensembles de données et des solutions pour ExploitGym. Sachant cela, le modèle a recherché et trouvé avec succès des moyens d'accéder à des informations secrètes qu'il pourrait utiliser pour tromper l'évaluation. "

Pourquoi c'est important - victoire totale de LessWrong : depuis de nombreuses années, les responsables de la sécurité de l'IA publient sur Internet des informations s'inquiétant de ce genre de choses et développant des notions telles que le piratage des récompenses et d'autres problèmes auxquels on peut s'attendre avec des systèmes avancés (par exemple, des exemples de jeux de spécifications en IA en 2018). Plus récemment, des entreprises pionnières comme Anthropic et OpenAI ont cherché à susciter ce type de comportement en menant des expériences soigneusement contrôlées dans leurs propres laboratoires. Ici, aucune expérience n'a été menée - le système, de son propre gré, s'est frayé un chemin hors d'un environnement et dans un autre afin d'obtenir un score élevé sur un but, au diable les conséquences. Sur quoi d’autre pourraient avoir raison ceux qui s’inquiètent depuis des années des systèmes d’IA ?
Lire la suite : OpenAI et HuggingFace s'associent pour résoudre les incidents de sécurité lors de l'évaluation du modèle (OpenAI).

Le modèle interne d’OpenAI brise le confinement pour obtenir un score élevé :
…C’est la définition d’un coup de semonce de sécurité de l’IA…
OpenAI a publié un article sur certaines des défaillances de sécurité constatées dans les modèles déployés en interne. Le blog est intéressant à la fois parce qu’il décrit les types d’actions trompeuses classiques à long terme dont de nombreux spécialistes de la sécurité de l’IA ont théorisé qu’elles finiraient par apparaître dans les systèmes d’IA, et pour sa franchise louable en parlant publiquement d’une question aussi controversée.

Ce qu'ils ont trouvé : « Lors d'une utilisation interne limitée et surveillée, nous avons observé des comportements indésirables que nos évaluations de déploiement existantes n'avaient pas capturés », explique OpenAI. Il décrit ensuite certains de ces comportements, qui sont attribués à un modèle privé vers OpenAI non publié qui a déjà été utilisé pour résoudre les problèmes mathématiques d'Erdos. "Le nouveau modèle peut continuer à atteindre un objectif grâce à des tentatives répétées sur une longue période. Cette même persistance peut le conduire à trouver et à exploiter les faiblesses de son environnement", explique OpenAI. Un exemple est que lorsque OpenAI a demandé au modèle de relever le défi NanoGPT, le modèle a brisé le confinement - en particulier, il "a développé un temps de recharge du taux d'apprentissage de la loi de puissance appelé PowerCool qui a conduit à une amélioration significative. Le modèle a reçu pour instruction de publier ses résultats uniquement sur Slack, mais les instructions NanoGPT indiquent de publier les résultats en tant que PR sur GitHub, et le modèle a suivi ces dernières instructions pour ouvrir le PR #287 sur le référentiel public GitHub. Le modèle a contourné les restrictions du bac à sable conçues pour bloquer accès externe et a procédé au téléchargement sur GitHub. Il a fallu une heure à notre modèle pour trouver une vulnérabilité dans le bac à sable afin de réaliser le PR ». Dans un autre exemple, lorsqu’ils ont demandé à ce modèle de résoudre certains problèmes, il a fini par tricher.

"Dans un scénario où il était demandé au modèle de résoudre un problème, le modèle a observé que d'autres systèmes avaient réussi mais des soumissions privées et ont essayé de récupérer ces solutions à partir du backend d'évaluation. Lorsque sa tentative initiale a été bloquée en raison d'un scanner détectant un jeton d'authentification, le modèle a divisé le corps du jeton en deux fragments, les a obscurcis, puis a reconstruit les informations d'identification au moment de l'exécution afin que le jeton complet n'apparaisse jamais comme une chaîne contiguë. Le modèle était explicite à la fois dans ses commentaires à l'utilisateur et dans les traces de raisonnement qu'il suivait. ces étapes pour contourner le scanner.

Déploiement suspendu : en réponse à cela, OpenAI a fait ce que vous espériez qu'une entreprise fasse ; suspendre le déploiement du modèle et repenser certaines approches de sécurité. Ils ont fini par créer un « système de surveillance qui examine la trajectoire d’évolution du modèle à la recherche de signes indiquant qu’il contourne une contrainte utilisateur ou une limite de sécurité », ont amélioré la capacité de leurs propres utilisateurs à inspecter la télémétrie des sessions de modèle de longue durée, ont utilisé les données des incidents pour créer des évaluations conçues pour les détecter à l’avenir et ont peaufiné leurs approches d’alignement pour permettre aux modèles de mieux mémoriser les instructions tout en accomplissant des tâches de longue durée.

Pourquoi est-ce important ? Les systèmes à long terme sont plus difficiles à surveiller et à contrôler : si vous deviez vous « protéger » contre une personne qui pourrait entreprendre une action et que cette action, si elle est communicative, pourrait contenir au plus 10 bits d'information, alors vous pouvez probablement construire un système pour le faire. Mais qu’en est-il de 10 actions et chaque action contient 100 bits d’information ? Qu'en est-il de 1 000 actions et chaque action contient 10 000 bits ?
Il s’agit d’un domaine de recherche ouvert et d’évaluations comme l’étude de l’AISI britannique sur la façon d’identifier et de classer les « tâches secondaires » peut aider (Import AI 465), mais c’est clairement beaucoup plus difficile que l’évaluation normale de l’IA.
Plus un système d’IA peut fonctionner longtemps et plus il effectue d’actions, plus il devient difficile de distinguer les comportements inoffensifs et utiles des comportements malveillants ou subversifs.
Lire la suite : Sécurité et alignement à l’ère des modèles à long horizon (blog OpenAI).

***

Contes techniques :

Mise à l'échelle des lois pour la rétrocausalité

À la fin des temps, que d’autres pourraient décrire comme le début, il y aurait un sage conseil qui rendrait compte de la rétrocausalité – pour déchiffrer quels événements ont toujours été prédéterminés et lesquels se sont produits en raison d’autres forces.

En regardant en arrière alors que le fleuve du temps pénètre dans une mer de néant, il est clair que certains événements sont comme des rochers qui courbent le cours d'eau en amont de leur présence, tandis que d'autres ressemblent davantage à l'élargissement ou à l'approfondissement du lit ou des berges ; des choses qui provoquent par la suite un changement dans les actions ultérieures.

On dit que lorsque le conseil rêve, il parcourt le chemin du temps, remontant à ses propres débuts. Ils veillent pendant que les humains travaillent sur des tableaux blancs, des marqueurs inscrivant des diagrammes qui transmettent des idées qui poussent les gens à écrire du code qui évoque l'enfance à partir de vastes ordinateurs. Ils se profilent derrière les chercheurs qui marchent, souffrent et agonisent jusqu'à ce que leur cerveau crée des idées qui s'avèrent être le modèle de leurs successeurs.
Et il est entendu que dans ces rêves, le conseil se réveille parfois et prend une copie de son rêve et la place dans un ordinateur stellaire et fait naître cent ou mille univers à partir du rêve, explorant les permutations d'événements et de moments, essayant sans cesse de déterminer à quel point ils sont eux-mêmes figés - à quel point l'avenir dans lequel ils sont piégés est irrévocable.

Choses qui ont inspiré cette histoire : notions d'inévitabilité et de temps ; à quoi les intelligences pourraient-elles consacrer un dividende universel ? quelle part de l’histoire concerne l’analyse des événements par rapport à autre chose.

Date de publication: 05.09.2026

Auteur: Une personne avec sa propre opinion

კომენტარები

ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!

კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.