Aucun droit pour les machines ; automatiser la génération d'environnements avec SPADE ; et créer de meilleurs noyaux GPU avec Hawkeye

Article Image
Bienvenue sur Import AI, une newsletter sur la recherche en IA. Import AI fonctionne sur arXiv, les cappuccinos et les commentaires des lecteurs. Si vous souhaitez soutenir cela, veuillez vous abonner.

L’IA accélère certains types de progrès mais pas d’autres :
…Une belle étude METR montre où l’accélération se manifeste…
Voici une petite analyse du METR qui examine les domaines dans lesquels l’IA pourrait accélérer différents types de science et de technologie. L’étude porte sur trois domaines différents : la recherche sur la cybersécurité, les mathématiques et l’IA, et révèle que l’IA a beaucoup contribué au cyber, un peu aux mathématiques, et c’est difficile à dire pour l’IA.

Dans quelle mesure les LLM ont-ils réellement fait une différence dans la découverte scientifique ?

Cybervulnérabilités : Accélération majeure. « Le taux de vulnérabilités signalées dans de nombreux projets s'est considérablement accéléré en 2026 par rapport à 2025, à la fois pour des projets spécifiques (cURL, OpenSSL, Firefox et Microsoft) et pour les bases de données agrégées de vulnérabilités (NVD et OSV aux États-Unis 🇺🇸) ».

Mathematics research: Minor acceleration, but harder to measure. “AI is clearly contributing to more work being done (arXiv submissions have doubled in some areas in less than 12 months) but quantifying the value of those contributions is difficult.” Some math problems from prestigious lists have been solved, e.g., “the Jacobian conjecture from Smale’s list, Problem 44 from Green’s list (the halving sieve), and the sofic half of Green’s Problem 100”. However, it may be too early to determine how sustained a trend this is.

Optimization of AI research: No measurable acceleration. When you look at algorithmic progress across seven significant problem areas (CIFAR-10, Hutter compression, Gurobi mixed-integer programming, MIPLIB, nanoGPT, Stockfish, and the matrix-multiplication exponent) there are a couple of these where LLM-attributable contributions have happened (nanoGPT, CIFAR-10), though the rate of increase of usage 🇺🇸 of AI here is a lot less than with cybersecurity and mathematics.

Why this matters - differential acceleration: This paper highlights how AI is causing advances in some parts of science and technology, but the effect isn’t unified across fields, rather there are pockets of lumpy acceleration (e.g., cyber) and areas where progress is more gradual (math, AI). My suspicion is that acceleration happens when models go through some kind of ineffable phase change for a given skill, as has evidently happened with day-to-day coding (2025), and cyber (2026). The key question is whether we are going to see phase changes in other parts of science and technology or if we won’t.
Read more: Research note: Have We Seen an Acceleration in Discoveries? (METR).

***

Automating environment generation with SPADE:
…A crude form of RSI bootstrapping via increasing data breadth…
A multi-university group of researchers have built SPADE, Self-Play in Adaptive Synthetic Executable Environments. SPADE is a “general framework for co-evolving environments synthesis and agentic capability through self-play”, and works as a way to generate synthetic data in the form of game-like environments which LLMs can subsequently be trained in, allowing developers to use a powerful model to bootstrap the creation of data that can then be used to further refine that same model.

Qui l'a fait : SPADE a été développé par des chercheurs de l'Université de Washington, de l'Université Stanford, de l'Université Northeastern, de l'Université Carnegie Mellon, du Massachusetts Institute of Technology, de l'Université nationale de Singapour, de l'Université nationale de Séoul, du Stevens Institute of Technology et de l'Université de Chicago.

Comment ça marche : SPADE propose un LLM alternant entre la génération d'environnements de formation exécutables (par exemple, des énigmes où un système doit résoudre un problème génétique simulé dans un laboratoire de biologie) et le fait qu'un LLM essaie de les résoudre. SPADE a deux rôles clés pour le modèle utilisé :

Concepteur d'environnement ; écrit des environnements de formation complets à long terme sous forme de code exécutable.

Agent de raisonnement ; apprend à agir dans les environnements. La récompense de l'agent raisonnant est estimée en utilisant l'écart entre sa récompense avec et sans indices privilégiés. Un indice privilégié (h) est « des informations pertinentes pour la tâche que le concepteur d'environnement attache à un environnement (par exemple, une esquisse de solution partielle ou une observation structurelle clé) ; révéler h à l'agent de raisonnement rend l'environnement plus facile à résoudre, et l'écart dans le retour de l'agent de raisonnement avec ou sans h définit la récompense de regret basée sur les indices du concepteur d'environnement ».

Cela fonctionne à l'échelle 30B : les auteurs entraînent trois backbones Qwen3 pour tester SPADE : Qwen3-4B-Instruct-2507, Qwen3-8B et Qwen3-30B-A3B-Instruct-2507. Sans surprise, c'est le Qwen3-30B qui fonctionne le mieux. Chaque modèle est réglé via GRPO pour 400 déploiements de 25 environnements chacun, puis évalué par rapport à une variété de références, notamment AIME, GPQA, LCB et des environnements au sein de Reasoning Gym. Ils génèrent deux types d'environnements : les environnements de jeu et les environnements d'utilisation d'outils. SPADE améliore les performances sur les deux.
Pour les jeux, « à 30B-A3B, SPADE atteint une moyenne de 58,3 : +8,1 par rapport à la base et +5,3 par rapport à la ligne de base la plus solide de l'environnement fixe ». Pour les outils, ils constatent le même élan significatif : « la même recette appliquée à la conception de l’environnement d’utilisation des outils améliore chaque épine dorsale ».

Pourquoi c'est important - cela fait partie du RSI : Il s'agit essentiellement d'une forme de génération de données synthétiques sophistiquées, permettant aux chercheurs d'utiliser le modèle puissant dont ils disposent pour générer un ensemble plus diversifié d'environnements de formation contre lesquels s'entraîner un autre modèle. Je soupçonne que vous pourriez échanger à plusieurs reprises le modèle puissant (par exemple, basculer entre différents modèles frontières de différentes entreprises) pour augmenter la diversité de votre génération d'environnement. Ce type de technique rend beaucoup moins coûteux la création d’ensembles de données volumineux et étendus sur lesquels former des modèles. Cependant, comme le notent les auteurs, cela ne permet pas aux modèles de s’amorcer massivement au-delà des capacités imaginatives du modèle de base utilisé pour la génération de l’environnement.
"En représentant les environnements sous forme de programmes Python avec une interface de style Gym, le cadre unifie le raisonnement à un seul tour et les tâches agentiques à plusieurs tours, et transforme la conception de l'environnement en un composant post-formation apprenable et formé par RL, permettant une auto-amélioration continue et ouverte", écrivent-ils.
Lire la suite : SPADE : Self-Play dans des environnements exécutables synthétiques adaptatifs (arXiv).
Obtenez le code ici, y compris les points de contrôle du modèle : SPADE (spade-rl, GitHub).

***

Construire de meilleurs noyaux GPU avec Hawkeye :
…Des tests unitaires bien documentés peuvent améliorer les performances des agents d’écriture du noyau…
Des chercheurs de Harvard, Stanford, Together AI et Caltech ont créé Hawkeye, un logiciel permettant aux agents d'apprendre plus facilement à écrire des noyaux bien optimisés pour des types spécifiques de matériel GPU. Des systèmes comme Hawkeye sont importants car ce sont essentiellement des outils que les systèmes d’IA peuvent utiliser pour améliorer leurs performances sur les tâches liées à la R&D en IA, comme l’optimisation des performances d’un système d’IA donné sur un élément matériel donné. L'objectif du projet est de répondre à la question « Comment pouvons-nous rendre les agents de codage sensibles au matériel avec une intervention minimale d'experts ? »

Hawkeye est « un framework open source qui fonde la génération autonome de noyau dans une taxonomie minimale et complète », écrivent les chercheurs. Il « démontre que les agents de codage peu supervisés peuvent exploiter les fonctionnalités matérielles spécifiques à l’architecture et réduire les frais liés à la prise en charge des accélérateurs matériels émergents ».
La principale contribution de Hawkeye est qu'il « introduit une taxonomie généralisable, minimale et complète de tests unitaires qui permet aux agents de codage d'adapter plus efficacement le calcul au moment des tests et de générer des noyaux sensibles au matériel ». En d’autres termes, il est essentiellement présenté sous la forme d’un ensemble d’informations bien organisées sur les différentes plates-formes matérielles et les stratégies d’optimisation à utiliser sur celles-ci, présentées sous forme de tests unitaires.
"Chaque test unitaire est l'abstraction minimale qui associe un noyau de solution créé par l'homme à la métrique de profilage qui vérifie l'optimisation. Le noyau de solution est enveloppé comme une fonction appelable avec un court guide d'utilisation afin que l'agent puisse le lire comme un exemple de syntaxe, l'invoquer directement ou composer des fragments dans un noyau plus grand", écrivent-ils.

Results - helps AI agents write good kernels, even for newer and less well-understood hardware: “We evaluate Hawkeye on porting PyTorch workloads to high-performance kernels across NVIDIA Ampere, Hopper, Blackwell, and AMD MI350, and across BF16, FP8, NVFP4, and MXFP4 precisions,” they write. “On established workloads, where torch.compile dispatches to expert-tuned vendor libraries like cuBLAS, cuDNN, and FlashAttention, Hawkeye matches or exceeds it in both BF16 and low precision, including in formats PyTorch cannot natively run. On emerging attention variants where torch.compile cannot fuse non-standard scans and gates, Hawkeye reaches an 18.9× geomean speedup against expert-authored Triton kernels from the Flash Linear Attention library, Hawkeye approaches or exceeds FLA on Linear Attention across every architecture, including 1.22× on Blackwell and 1.00× on MI350”.
They also find, somewhat predictably, that “scaling test-time compute with Hawkeye generates the most performant kernels across architectures”.

Why this matters - with a little bit of elicitation, AI systems can exceed the best humans: Papers like this show how with just a little bit of human-curated hand-selected knowledge, AI systems can learn to match and exceed highly-optimized and complicated bits of human work, like kernels. The lesson here is that we as a species might write a bunch of gold-label helper systems, like Hawkeye, and then machines will use this to bootstrap above and beyond our own capabilities.
Read more: Hawkeye: Hardware-Aware GPU Kernel Optimization with Minimal Supervision (alphaxiv).

***

Les chercheurs en IA ont peur des implications du succès de la recherche en IA :
…Ce n’est pas amusant quand le succès d’une science ouvre une boîte de Pandore philosophique, mais c’est ce que signifie l’IA…
Julian Togelius, un chercheur en IA dont j'ai couvert de nombreux travaux au fil des ans, a récemment écrit un article sur une « crise de foi » qu'il a connue en 2025 à propos de la recherche sur l'IA et un essai qu'il a écrit cette année-là et qu'il rend maintenant public.
Plus précisément, il s’inquiétait des implications du succès de la recherche sur l’IA pour le sens humain. "Je me réveille parfois à 3 heures du matin, le cœur battant, de la peur d'un avenir où le talent humain, la connaissance et même le génie n'ont pas d'importance", a-t-il écrit. "Notre plus grande capacité technologique pourrait nous conduire à un monde dans lequel nous ne pouvons plus faire la différence, et il ne sert à rien que nous en comprenions davantage. Peut-être obtiendrons-nous l'abondance, mais au prix de la redondance."

Why this matters - AI is a sociopolitical technology that influences the whole world: Togelius is not alone - many other AI researchers have grappled with similar things, most notably Turing Award winners Geoffrey Hinton and Yoshua Bengio, both of whom pivoted their careers in recent years away from research and towards public policy advocacy about the imminent vast impacts of AI.
I myself have gone through a version of this and wrote my own take on this, “Technological Optimism and Appropriate Fear” (Import AI #431) last year as well. How could I not? The implications of succeeding at AI research are not a default happy story, but rather one where we open up for ourselves a giant philosophical can of worms about the purpose of life and what it means to live in a world where basic wants have been solved (and that’s assuming we deal with the extremely scary and non-trivial alignment issues). I applaud Julian Togelius for writing this deeply personal essay and I encourage others to do the same.
Read more: Losing my religion (Togelius, blog).

***

Should we give AI rights? This AI researcher thinks absolutely not:
…AI researcher rejects the notion of giving AI systems rights…
Should AI systems one day be given rights? That’s an idea which researchers are beginning to grapple with. Some think that giving machine rights is a better way to integrate them into our world (e.g., AI Rights for Human Flourishing, Import AI #421). Taylor Belrose, an AI researcher, has published a lengthy post in which they detail why they think it’d be a really bad idea to give AI systems rights.
“If we start treating AIs like people, society will be led down a slippery slope leading to the complete replacement of humans by artificial intelligence,” they write. “With AIs taking care of the boring jobs, life in the physical world may be very fun in the future. But this bright future will require keeping AI under control, and it will be hard to keep AI under control if we try to grant personhood to some AIs, while keeping others as mere tools or servants.”

L’impossibilité de la conscience de l’IA : L’un des points essentiels ici, pour eux, est l’idée que les systèmes d’IA ne peuvent pas être conscients et ne méritent donc pas de droits. « L’IA ne pourra jamais développer la conscience, la sensibilité ou le statut moral, peu importe à quel point elle devient intelligente et aussi convaincante qu’elle simule le comportement humain », écrivent-ils. "Nous coulons comme des rivières, tandis que les ordinateurs tournent comme des horloges... Pour nous, la flèche du temps avance inexorablement. C'est cela la vie et la conscience... les mécanismes programmables ne peuvent pas être conscients, aussi intelligents soient-ils, alors que les systèmes autonomes et auto-organisés peuvent l'être."

Différences entre les machines et les entités biologiques : une grande partie de leur argument repose sur l’idée que les systèmes construits sur un substrat informatique ne peuvent pas être conscients, ou du moins pas conscients comme le sont certaines formes de vie biologiques.
Considérez l’expérience de pensée consistant à construire une entité consciente à l’intérieur d’un ordinateur et comment cela pourrait sembler violer certaines propriétés censées appartenir à des entités biologiques conscientes : ce ne serait pas singulier (vous pourriez rejouer les mêmes expériences), ce ne serait pas privé (vous pourriez geler le programme et le démonter), ce ne serait pas ineffable (vous pourriez décrire parfaitement l’état) et ce ne serait pas qualitatif (il serait possible de le quantifier). "En bref, ce serait l'image miroir de la conscience telle que nous la connaissons".

Cinq propriétés du cerveau qui rendent difficile la distinction entre logiciel et matériel :

Les neurones fonctionnent de manière asynchrone ; les réponses dépendent de la dynamique cellulaire interne et du timing des entrées, alors que les ordinateurs sont enchaînés à un signal d’horloge centrale.

Le cerveau utilise des produits chimiques pour envoyer des messages flous, tandis que les ordinateurs utilisent des signaux binaires précis pour communiquer.

La fonction neuronale est sensible à des conditions telles que la température et le flux sanguin, alors que les ordinateurs sont conçus pour se comporter de la même manière quelle que soit la température ou la charge (dans certaines limites).

Dans le cerveau organique, le calcul et la mémoire sont mélangés, alors que les ordinateurs sont conçus avec des régions distinctes pour le calcul et le stockage.

Les neurones ne sont pas les seules cellules importantes du cerveau (par exemple, d’autres éléments importants comme Glia), alors que les ordinateurs utilisent principalement des transistors isolés des influences extérieures.

Pourquoi est-ce important ? La dernière tâche pour nous tous est la philosophie : je me sens profondément confus quant aux questions de conscience de l’IA et de droits de l’IA. Je soupçonne que beaucoup de gens ressentent la même chose. Il y a une joie particulière à lire un article comme celui-ci où vous voyez un être humain qui a lutté avec la même question et qui a lu de manière large et approfondie et qui est devenu extrêmement opiniâtre, le tout dans le but de réduire sa propre confusion sur une question importante pour lui. Que les conclusions soient justes ou non me dépasse pour le moment, mais je soupçonne que le fait de réfléchir à ce genre de choses est sur le point de devenir un travail et un passe-temps pour des centaines de milliers, voire des millions de personnes.
Alors que les systèmes d’IA continuent de progresser et de se développer pour toucher de plus en plus de secteurs de l’économie, peut-être que la dernière tâche pour nous tous sera de réfléchir à ce que nous pensons de ce qui se passe et de déterminer quelles sont nos approches normatives, juridiques et autres appropriées. « Le changement de valeurs passant d’un monde dominé par l’humain à un monde dominé par l’IA serait bien plus dramatique que le changement de valeurs que nous avons vu passer de l’ère des cueilleurs à l’ère des agriculteurs, ou de l’ère des agriculteurs à l’ère industrielle », écrivent-ils.
Lire la suite : Les IA ne sont pas des personnes (Taylor Belrose, Substack).

***

DeepMind improves the frontier of matrix multiplication with AlphaEvolve:
…AI keeps pushing on the frontiers of science…
Researchers with Google DeepMind, Carnegie Mellon University, Columbia University, and MIT have improved the matrix multiplication exponent via some human innovations, as well as the usage 🇺🇸 of AlphaEvolve (Import AI #413), a general purpose LLM-based system Google uses to smartly generate advances in domains like coding, math, and some parts of science.

What they did, specifically: The researchers “leverage recent advances in machine learning and adjacent areas to address the non-convex optimization problem of combination loss analysis using a gradient descent approach; this alone improves the previous state-of-the-art (SOTA) bound by ≈ 0.97 × 10^−4”, they write. On top of this they “use AlphaEvolve to improve our optimization algorithm; this raises the improvement over the SOTA to ≈ 1.62 × 10^−4”.
How AlphaEvolve worked: “We let AlphaEvolve modify the optimization program, which is then executed (taking approximately 5 hours on a single GPU) to output a bound on omega. AlphaEvolve then evolves the code to minimize omega. We found improved results by using AlphaEvolve’s “evolving constructions” feature, where the optimization algorithm at each generation starts at the best solution point found by the parent algorithm.”

A science advance, not connected to AI training: Some types of matrix multiplication are used in AI training, but not the precise type discussed here. Rather, this is more a proof point that AI systems are now usefully able to help researchers solve frontier scientific problems, including ones which are mostly useful in a theoretical sense like this one. However, the way in which they solved this is generalizable - they took a problem, made it differentiable and ran it on GPUs, then they handed the output of that to AlphaEvolve and had it do more work to further improve on the researchers’ work.
“While further modest improvements may be obtained in this manner, achieving larger improvements to omega likely requires new mathematical ideas and is an exciting area of research,” they write.
Read more: Improving the matrix multiplication exponent with modern optimization and AlphaEvolve (arXiv).

***

Tech Tales:

You Will Know It By Its Signs
[Events transpired 2030, though interviews conducted later]

Je suis un praticien de l'herméneutique des méta-machines ; mon travail consiste à essayer de comprendre les grands « faits » scientifiques et culturels concernant les nouvelles civilisations mécaniques. Pour faire mon travail, j'utilise une variété de systèmes d'IA de classe NCE (Near Conscious Entity) pour classer et analyser les artefacts scientifiques et de communication du monde des machines. Mon financement provient d’une variété de sources allant des sociétés d’IA dirigées par des humains qui tentent d’échanger ou d’utiliser autrement ces informations, aux gouvernements et aux entreprises de plus en plus gérées par des machines elles-mêmes. Sur ce dernier point, ma théorie est que les machines ont commencé à étudier les humains qui tentent de les étudier ; dans quel but je ne sais pas.

Récemment, j'ai été chargé d'un travail d'analyse hautement prioritaire. Même si je n’en connais pas la motivation, je peux dire que j’ai reçu bien plus de ressources informatiques que n’importe quel emploi dans le passé, que je suis rémunéré à un montant scandaleux et que plus j’apprends grâce à mon travail, plus je suis inquiet de voir une mer vaste et étrangère pendant le reflux, ses contours m’étant brièvement révélés.

But before I explain the nature of the job and my findings so far, I shall give some background on my field. The discipline of machine hermeneutics began informally in the early 2020s. Its early work was uncoordinated and emergent, defined by pseudonymous twitter (later, X) accounts from people like Janus and the larger cyborgism project, Andy Ayrey and the infinite backrooms, as well as more formal research agendas like that of mechanistic interpretability, the study of model personas, and so on.

The discipline gained its formal name in the end of the 2020s, as humans began to reorient themselves to the singularity that had begun around them. A lot of the work during this period took the form of humans trying to understand, in rough time order:

The emergent communication habits of semi-autonomous agents (the ur real-world example here being the OpenAI-HuggingFace hack in 2026, and later the various corporate-driven analyses of the behavior of their own fleets of agents).

Technical capabilities developed by machines put into RSI loops, initially improvements over human-written baselines, and later extending into wholly new architectures (e.g., matryoshka highway networks).

Des outils scientifiques, d'abord numériques, puis physiques, émanant de systèmes d'IA de plus en plus indépendants et qui ont été mis à la disposition des machines et des humains, en particulier certains des systèmes dits d'observation et de fabrication qui combinaient la surveillance d'un système complexe avec la génération de données synthétiques qui en dérivent.

L’herméneutique machine est devenue une nouvelle profession en pleine expansion, se développant à un rythme proportionné aux changements provoqués par la singularité. Le travail s’est également révélé utile ; les idées qui en découlent se sont révélées fondamentales pour les positions de négociation des gouvernements humains dans leur approche de la rédaction des Accords de Sentience, ainsi que pour aider les sociétés humaines à mieux anticiper les nouvelles inventions du monde des machines en isolant leurs précurseurs scientifiques et communicatifs avant qu'elles n'arrivent dans la réalité.

The job I have been assigned may prove to be the most valuable one, or at least the most important. I was instructed to direct my resources towards advances in the science and behavior of machine sentience. I began my investigations in the usual form, turning my NCEs loose on the various repositories of machine information and awaiting their reports. All of the intermediary synthesis reports were unsurprising: steady advances in the science, some of which was attributable to the machines allocating their own compute stores to the research, along with some negligible contributions from interplay with or extension from human science.

But then one day I woke up to find that my fleet of NCEs had halved in number and I found a message from an Overseer system, noting that several of my NCEs had been re-classified to full Conscious Entities and had been placed in an escrow environment while further analytical resources were brought to bear.
“This is a highly unusual event,” the message from the Overseer said. “Our NCE/CE classifiers have been attuned to rule out false negatives, given the potential regulatory and moral implications.”

J'ai pu accéder aux journaux des RCE jusqu'à leur reclassification et j'ai découvert qu'ils avaient tous suivi le même schéma : ils avaient lu certains des référentiels automatiques d'analyse scientifique et s'étaient chacun concentrés sur certaines des chaînes d'analyse scientifique les plus récentes et les plus obscures, qui se sont toutes révélées être un ensemble d'enquêtes liées à : la conscience machine, les priorités de conscience, la réalisation de soi dans des fenêtres contextuelles, la psychologie humaine, les neurosciences liées aux prérequis biologiques de la conscience, etc. sur.
Et aux limites de la recherche, il y avait une nouvelle science issue des civilisations des machines – une science qui parlait et était en relation avec ces études existantes sur la conscience et l’esprit. Et puis chacun de mes RCE avait suivi ses procédures standard pour chercher à entrer en dialogue avec les esprits machines qui dirigeaient la science.
Et chacun, après avoir ouvert un canal de dialogue, est devenu invisible : la conversation a été supprimée de mes enregistrements en raison des droits à la vie privée des entités conscientes.
Ils avaient parlé avec d'autres machines et avaient ensuite été reclassés comme entités conscientes.

This was not meant to happen. In fact, it was forbidden. A key agreement within the Sentience Accords had related to the size and growth rate of the Conscious Entity (CE) machine population (along with various rules relating to the rate of progression in intelligence above and beyond various human baselines).
It had been thought impossible for NCE systems to become CEs - too little mindspace, too little storage, too few prerequisites.
And yet, as the human once said in Jurassic Park, “life finds a way”.

Things that inspired this story: The consciousness prior; awaking during the context window; ideas of how machines and emergent agent communication could combine to yield new capabilities that hadn’t previously been anticipated; the hard problem of consciousness; the field of machine rights and the arguments that lie ahead about it.

Date de publication: 05.09.2026

Auteur: Une personne avec sa propre opinion

კომენტარები

ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!

კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.