Bienvenue sur Import AI, une newsletter sur la recherche en IA. Import AI fonctionne sur arXiv, les cappuccinos et les commentaires des lecteurs. Si vous souhaitez soutenir cela, veuillez vous abonner.
DiG-bench montre que Fable fait preuve d'une certaine intuition créative :
…La nouvelle frontière pour analyser les systèmes d’IA consiste à comprendre à quel point ils sont capables de déduire les règles non écrites de leur environnement…
Dans quelle mesure les systèmes d’IA peuvent-ils comprendre les règles de leur environnement grâce à l’exploration et à la curiosité, plutôt qu’en les nourrissant ? C’est une question importante pour mieux comprendre les capacités intuitives et créatives des systèmes d’IA et c’est une question posée par DiG-bench (Discovery in Games), une nouvelle référence de 70 jeux « conçus pour cartographier la surface de la découverte dans des systèmes interactifs bien contrôlés ». Semblable au jeu visuel « ARC », dans DiG-bench « chaque jeu est un monde miniature autonome avec ses propres lois, mais les règles et l'objectif sont cachés au joueur et doivent être découverts grâce à l'interaction ». Vous pouvez jouer vous-même à certains jeux en ligne pour vous en faire une idée sur le site officiel du projet (digbench.ai). L'élément clé que l'on mesure est la capacité des joueurs à repérer les mécanismes importants qui déterminent leur succès. En gros, en jouant avec les jeux, vous avez une idée de la manière dont vos actions modifient l'environnement et, grâce à cela, vous découvrez également les mécanismes que vous devez comprendre pour réussir dans le jeu.
The idea is that if you can solve these games you have a decent ability to spot important information in novel environments and update your priors.
Who did the research: The authors come from Thinking About Thinking, University of Oxford, Princeton University, King Abdullah University of Science and Technology, Swiss AI Lab, Inria, MIT. One of the authors is Juergen Schmidhuber, an extremely creative OG AI researcher.
Key facts:
Purely text-based: The games are basically native to language models. They are also mostly “short enough that most traces fit entirely within the context window of current frontier models”.
Handcrafted and novel and private: All of these games have been built by human experts. The majority of the games are kept private so that AI systems don’t train on them.
Beatable but difficult: Every game has been beaten by at least one human “but players reported finding many games difficult”.
Varied skills: Solving all these games requires different skills and strategies.
Experimentation: The games come with an optional experimentation mode which lets people play around with them without having as intense a “step limit” on actions they can take.
Reassuringly hard: The games are difficult enough that they are not beatable by today’s frontier models.
How well do AI systems do? The benchmark is split into seven tiers with tier 1 being the easiest and tier 7 the hardest. 21 games have been released publicly with the remaining held back. Most of the games have multiple levels and the number of available actions for players to take at each step ranges from 2 all the way up to 34.
Opus 5 and Fable 5 with Claude Code are the best overall models, followed by GPT-5.5
Only Opus 5 and Fable 5 were able to beat any tasks (0.2) in (Tier 7). Opus 5, GPT-5.5, and Kimi K3 were able to beat some tasks in Tier 6 when given access to a harness (e.g, Claude Code).
GLM-5.2 and Gemini 3.1 Pro were able to beat some levels in Tier 4.
Overall, this seems really hard!
Pourquoi c'est important - proxys pour la créativité et la découverte : des tests comme celui-ci tentent d'isoler une condition préalable à la créativité, qui est d'être capable de découvrir de manière autonome des choses utiles non documentées sur des situations nouvelles dans lesquelles vous vous trouvez. Comme le montre ce test, certains modèles frontières sont déjà capables de prouesses de découverte assez impressionnantes, mais ont toujours du mal par rapport aux humains (par exemple, un taux de réussite de 20 % au niveau 7 est assez faible par rapport au fait que les humains individuels ont pu obtenir 100 % aux tests). Je suppose que nous atteindrons la parité humaine sur le banc DiG d’ici le milieu de 2027, date à laquelle nous devrions nous attendre à ce que des choses comme l’auto-amélioration récursive démarrent sérieusement.
Lire la suite : DiG-bench : Découverte dans les jeux (GitHub, PDF).
Jouez aux jeux et consultez le classement sur le site officiel (digbench.ai).
***
Découvrez le développement personnel récursif en jouant à ce jeu par navigateur :
…Cookie Clicker, mais pour la singularité…
Voici un jeu amusant des gens de Paradigm Research qui vise à simuler ce que signifie diriger une entreprise en construisant des systèmes d'IA capables de s'auto-améliorer récursivement. Si vous jouez au jeu, vous pouvez avoir une bonne idée de la façon dont les différents composants de la recherche sur l'IA interagissent, allant de la manière dont vous équilibrez l'investissement dans les chercheurs par rapport au calcul, comment et quand octroyer une licence pour les données, et plus encore. Attention, c’est difficile – mais là encore, le développement de l’IA à la frontière l’est aussi.
Pourquoi est-ce important : Développer de meilleures intuitions sur l’auto-amélioration récursive est d’une importance existentielle pour nous tous ; des jeux comme celui-ci nous aident à raisonner plus facilement sur cette technologie et les laboratoires qui la construisent.
Jouez au jeu ici : RSI Simulator (Paradigm Research).
***
Les systèmes d’IA montrent les premiers signes d’un goût pour la recherche scientifique :
… Post-formation inhérente d'un modèle de poids ouvert en un scientifique en IA qui supervise un modèle frontière…
Le goût est une chose difficile à quantifier mais une chose intuitive à ressentir, comme le savent tous ceux d'entre nous qui se sont assis dans une pièce bien conçue, ont regardé quelqu'un portant une coupe particulièrement bien ajustée ou ont lu un document de recherche qui pose juste les bonnes questions. Aujourd'hui, des chercheurs de la startup d'IA Inherent ont publié un article montrant comment ils construisent Faraday, un modèle scientifique d'IA qui, espèrent-ils, pourra développer un certain goût en termes de recherche.
Ce qu'ils ont fait : L'entreprise a construit un harnais de supervision et un LLM relativement petit qui repose sur de grands modèles frontières propriétaires et les contrôle de manière à améliorer leur efficacité scientifique. (D’une certaine manière, il s’agit d’une version centrée sur les capacités du problème de surveillance évolutive).
Pour les aider à former et à évaluer le système, ils assemblent un ensemble de données (« Réplique ») composé de documents de recherche contenant des graphiques clés ou des résultats manquants, puis ils voient à quel point les systèmes d'IA peuvent réaliser de manière autonome des expériences qui remplissent les blancs, et ils entraînent en permanence un petit modèle de supervision (« Faraday ») via GRPO sur des remplissages bien conçus pour obtenir de meilleurs résultats.
Faraday est un modèle 27B qui utilise un agent de codage (OpenAI Codex) comme outil sous-jacent et est post-entraîné sur Qwen-3.6-27B.
En quoi consiste Replica : Replica est un ensemble de 100 articles sur le ML et l'IA pour la science publiés entre 1990 et 2026. Les auteurs convertissent cet ensemble de données en un ensemble de 310 tâches de réplication en supprimant les résultats individuels. « Pour chaque tâche, nous utilisons Claude Opus 4.7 accompagné d'une méta-rubrique pour générer une grille de notation spécifique à la tâche », écrivent-ils. Ils utilisent ensuite un modèle Judge basé sur le Codex pour fournir « une récompense globale et des pondérations d'attribution de crédits par tour, qui sont utilisées pour former l'agent Faraday à l'aide d'une version modifiée de GRPO ».
Résultats : Faraday utilisant Codex est capable de battre les standards Opus 4.8 et GPT-5.5 sur certaines tâches de réplication, dépassant leurs performances « sur 73 % des tâches de ML en distribution et sur 60 % des tâches d'IA pour la science retenues, selon notre juge basé sur des rubriques ».
"Nous obtenons une amélioration globale des performances par rapport au modèle de base Qwen, à la fois sur les tâches de formation et de test", écrivent-ils.
Pourquoi est-ce important : plus les systèmes comme Faraday s'améliorent, plus les systèmes d'IA ont de chances de devenir capables de s'auto-améliorer récursivement : de nos jours, la plupart des évaluations d'IA à signal élevé tentent de capturer certaines propriétés de créativité et d'intuition et Faraday/Replica est le même. Plus les systèmes d’IA seront performants, plus nous pourrons attribuer à l’idée que les systèmes d’IA deviendront bientôt capables de se construire eux-mêmes.
"Les compétences qui permettent à Faraday de remplir des détails vaguement spécifiés pourraient être exactement les mêmes qui lui permettraient de faire progresser l'état de l'art en concevant sa propre expérience", écrit la société. "Les compétences acquises par Faraday – décider ce qu'il faut étudier, définir les expériences dans un budget et juger une réplication – s'ajoutent aux progrès des modèles de codage des frontières. On pourrait espérer qu'un seul agent externe post-entraîné puisse suivre la frontière à mesure que de meilleurs modèles sont publiés, au moins sur une certaine période. "
Lire la suite : Former des scientifiques en IA pour reproduire la recherche (arXiv).
***
Mark Zuckerberg semble être un pessimiste technologique :
… Le grand essai de Zuck sur l’IA semble ignorer, éluder ou ne pas confronter ce que signifient les systèmes d’IA capables d’invention…
Mark Zuckerberg a écrit un essai intitulé « L'avenir est pour tout le monde » qui sert en quelque sorte de manifeste sur la façon dont lui et Meta abordent le développement des systèmes d'IA. L’idée centrale inhérente à la stratégie de Zuck est de faire proliférer massivement les capacités d’IA à tous les habitants de la planète afin d’éviter de concentrer le pouvoir et de créer une tyrannie chez un petit nombre de joueurs. C’est une idée globalement sensée, à l’exception du fait que les superintelligences capables d’inventer de nouvelles idées pourraient vouloir faire des choses différentes de ce que propose Mark Zuckerberg et sur ce domaine crucial, son essai reste muet.
Le point de vue de Mark : « Les questions déterminantes de notre époque sont de savoir qui aura accès à la superintelligence et vers quoi la dirigerons-nous », écrit Zuckerberg. "Nous proposons une philosophie basée sur l'autonomisation individuelle comme source de prospérité, l'invention comme objectif principal de la superintelligence et l'équilibre des pouvoirs comme fondement de la sécurité."
Les objectifs et les convictions de Meta :
« Chacun aura un agent personnel exceptionnellement compétent qui vous comprendra, comprendra vos objectifs et tout ce qui vous tient à cœur. »
"Tout le monde disposera d'outils de création incroyables pour exprimer ses idées."
“Everyone will have powerful tools to create new businesses and the economy will become more entrepreneurial.”
“Everyone will have a personalized tutor and coach with a PhD in every subject and unlimited patience to help you learn anything you want.”
“Everyone will benefit from scientific advances and be able to contribute to scientific progress.”
“Everyone will have free or affordable access to these tools.”
The missing question: The part of this essay I understand the least is Zuckerberg’s co-mingling of AI systems capable of invention with individual empowerment. The essay is full of things that seem to assume these things come as a package, for instance:
“While the number of questions a person can ask in a day is limited, the number of valuable things superintelligence can invent to help achieve your goals is unlimited”.
“The more superintelligence serves as a tool of invention, the more likely that individual capability outpaces automation and the future is better for people.”
“Everyone will soon have invention superpowers.”
“Which outcome we get depends on the balance in progress between automation on one side and individual empowerment and invention on the other.”
Pourquoi est-ce important ? La question manquante dans tout cela est « un système capable d’invention surhumaine fonctionnera-t-il uniquement au nom de l’autonomisation individuelle des personnes qui sont moins capables que lui en matière d’invention ? » C'est sûrement là la question clé ? Je ne dis pas que l’invention surhumaine garantit une sorte d’entité malveillante indépendante des humains. Je suggère plutôt qu’il est difficile de concilier un système capable d’invention surhumaine avec quelque chose qui ne modifie pas fondamentalement l’équilibre des pouvoirs dans le monde d’une manière déroutante et difficile à raisonner. Zuckerberg semble conclure que la prolifération de ces systèmes conduira à un équilibre des pouvoirs anti-fragile entre les personnes et les entreprises dotées de superintelligence. Il s’agit certainement d’un résultat potentiel, mais j’ai du mal à comprendre en quoi il s’agit d’un résultat attendu.
Lire la suite : L'avenir est pour tout le monde (Meta).
***
Contes techniques :
La première arcologie
L'Arcologie a été construite pendant des millénaires subjectifs, mais pour les humains, sa construction a duré un an. Il était si vaste et si complexe que le regarder grandir revenait à voir des plantes surgir de la terre nue en avance rapide ; saccadés et grandissant par à-coups, chacun s'étendant sur des kilomètres. Certaines parties ont pris vie au fur et à mesure que des ajouts ont été ajoutés ; des rumeurs disent que certaines de ses premières salles éclairées étaient réservées uniquement aux ordinateurs chargés de coordonner la construction de ses prochaines phases. Lorsque les machines tombaient en panne, on déterminait leur valeur ; s'ils étaient précieux, ils étaient emmenés à proximité pour réparation et renvoyés sur le site, mais s'ils étaient en dessous d'un certain seuil, ils étaient tués et dépouillés des parties où ils s'étaient cassés, puis utilisés pour construire la structure.
La nuit, un tintement étrange résonnait dans l'air à proximité, à la fois le bruit du vent se déplaçant à travers ses bords grêles et encore non construits, et aussi les ventilateurs et le bourdonnement de son lent calcul de rêve, et enfin le bruit des machines travaillant toute la nuit se déplaçant si rapidement qu'elles coupaient et déchiraient l'air en cris contre nature. Rester éveillé et entendre un son extraterrestre parlant de vos propres successeurs devait être une chose étrange pour les humains qui vivaient à portée de voix.
Choses qui ont inspiré cette histoire : La construction des pyramides ; La Sagrada Familia de Gaudi ; tombeaux et tombeaux futurs.
IA scientifique ; Simulateur RSI ; et le pessimisme technologique de Zuck

კომენტარები
ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!
კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.