23 idées RSI ; PostTrainBench+ ; et comment la confiance et la transparence interagissent avec les courses d'IA

Article Image
Bienvenue sur Import AI, une newsletter sur la recherche en IA. Import AI fonctionne sur arXiv, les cappuccinos et les commentaires des lecteurs. Si vous souhaitez soutenir cela, veuillez vous abonner.

Voulez-vous pouvoir gérer le RSI ? Voici 23 idées politiques concrètes :
…L’IFP propose des recommandations politiques « à faible regret »…
Des experts politiques du groupe de réflexion IFP ont publié un ensemble d’idées destinées à aider « les décideurs politiques à commencer à faire face aux risques liés à une automatisation accrue de la R&D en IA ». Les recommandations impliquent 23 idées spécifiques réparties dans 7 catégories spécifiques. Si elles sont adoptées, ces recommandations donneraient également aux pays, en particulier aux États-Unis 🇺🇸, davantage de possibilités d'action sur le plateau de jeu à mesure que des systèmes puissants sont développés, leur donnant idéalement la possibilité de :

Accélérer « la diffusion des capacités de l’IA, en allouant le calcul et les talents à l’inférence et au développement de nouvelles applications d’IA ».

Accélérer « la R&D pour rendre l’automatisation de la recherche sur l’IA plus sûre, soit en améliorant directement la sécurité des modèles, soit en renforçant la résilience sociétale ».

Sept catégories d'idées :

« Assurer la transparence dans la R&D automatisée en IA

Améliorer la capacité de l’État à comprendre et à répondre à la R&D automatisée en IA

Développer une stratégie de gestion des risques pour la R&D automatisée en IA qui accélère les utilisations défensives et commerciales de l’IA

Accélérer le développement de la technologie de vérification de l’IA

Investissez dans la résilience de l’IA

Étendre l’avance américaine en matière d’IA pour donner aux États-Unis 🇺🇸 plus de temps pour gérer les risques liés à l’automatisation de la R&D en IA

Créer une valeur optionnelle pour la coopération internationale sur la gestion des risques automatisés de R&D en IA »

Pourquoi est-ce important : moins nous avons d'options pour gérer le RSI, plus les résultats seront pires : à l'heure actuelle, c'est comme si le monde conduisait le développement de l'IA dans une voiture qui n'a qu'une pédale d'accélérateur et pas de pédale de frein, sans parler de toute sorte de télémétrie sophistiquée pour connaître des choses allant de la vitesse de la voiture aux propriétés du moteur en passant par l'usure des pneus. Des propositions comme celle-ci de l’IFP construiront davantage de pédales et de systèmes de détection proverbiaux pour le véhicule de l’industrie de l’IA, ce qui signifie que si nous devons changer de cap ou ralentir, nous serons mieux à même de le faire en cas de crise.
Lire la suite : Comment les États-Unis 🇺🇸 devraient-ils se préparer à une R&D de plus en plus automatisée en matière d’IA ? (IFP).

***

Une courte histoire de Thèbes sur les machines intelligentes et les corps de robots :
…À quoi pourrait ressembler une interface avec une IA pendant le décollage ?...
Voici une courte histoire fictive amusante de Thèbes (@voooooogel sur X) sur l'expérience d'une personne dans le futur visitant un site géré par un puissant système d'IA. L'histoire présente des idées sur les pauses de l'IA, l'auto-amélioration récursive, ce que cela signifie pour les systèmes d'IA de commencer à effectuer des actions dans l'économie au sens large et comment nous, en tant qu'humains, pouvons être capables de raisonner ou de faire confiance aux machines intelligentes. Lisez-le !
Lisez l'histoire ici : L'arrivée d'un nouveau soleil (VGEL, site Internet).

***

Les deux ingrédients d’un ralentissement réussi parmi les entreprises rivales d’IA : confiance et transparence :
…L’analyse de la théorie des jeux suggère que des ralentissements sont possibles…
Des chercheurs du MIT et de Columbia ont analysé la nature de la concurrence entre les entreprises qui s’affrontent pour développer de puissants systèmes d’IA et s’il est possible pour les entreprises de parvenir à un ralentissement coordonné. Le document, intitulé Racing to Ruin, vise à répondre "pourquoi exactement la coordination est-elle difficile ? Et que faudrait-il" ?. La conclusion est que les deux variables clés pour obtenir des résultats stables sont un certain niveau de transparence sur le développement technologique, ainsi que la capacité de modéliser les autres entreprises comme des acteurs rationnels et dignes de confiance.

Ce qu'ils étudient : « Nous développons un modèle simple de concurrence en R&D entre duopoleurs à l'ombre d'un désastre », écrivent-ils. "À mesure que les entreprises pionnières développent la technologie, elles augmentent le risque d'un événement qui ramène de façon permanente à zéro les bénéfices de toutes les entreprises. Le risque est une fonction connue des niveaux technologiques des entreprises, et il vient du développement de la technologie, et non de son utilisation."

Ce que montre leur analyse : « Lorsque le suivi est suffisamment précis, tout équilibre s’arrête dans un temps fini, mais une nouvelle tentation apparaît : chaque entreprise voudrait s’arrêter en deuxième position, et n’en sort qu’après confirmation que son rival s’est arrêté », écrivent-ils. « Pour qu’un agent s’arrête le premier, c’est-à-dire sans savoir si son rival s’est arrêté, il parie à la fois sur le type de son rival et sur la rapidité avec laquelle son rival arrive : si son rival est rationnel, il s’arrête dès qu’il reçoit la nouvelle de son arrêt, et ne s’arrête jamais autrement ». La confiance et la transparence interagissent assez différemment selon le type de jeu joué : "La coordination séquentielle demande à une entreprise de s'arrêter en premier, en pariant qu'un rival rationnel lui rendra la pareille une fois la nouvelle arrivée. Par conséquent, une nouvelle plus rapide soulève le prix de la réciprocité", écrivent-ils. « À l’inverse, la coordination simultanée exige qu’une entreprise ne soit pas tentée de continuer la course et de s’arrêter seulement après avoir constaté que le rival s’est réellement arrêté… des informations plus rapides rendent plus attractif à la fois l’arrêt d’abord et l’attente de vérification ».

La transparence a des propriétés étranges : « La transparence est à double tranchant : une détection plus rapide rend moins coûteux l’attente de la confirmation qu’un rival s’est arrêté avant de s’arrêter soi-même au lieu de s’arrêter inconditionnellement, donc à niveau de confiance intermédiaire, augmenter la transparence peut d’abord détruire l’équilibre d’arrêt précoce (en rendant cet écart de free-riding attrayant) avant de le restaurer à mesure que la détection devient suffisamment rapide pour rendre l’arrêt auto-appliqué. »

La conclusion clé - éviter la mort repose sur la capacité à faire confiance aux autres entreprises : "Avec une faible confiance, tout équilibre court à la ruine : le désastre arrive avec une probabilité de un. Avec une confiance intermédiaire, l'arrêt immédiat et la course à la ruine sont tous deux des équilibres. Avec une confiance élevée, dans chaque équilibre, la probabilité que deux entreprises rationnelles s'affrontent pour toujours disparaît quadratiquement dans le rapport de cotes antérieur de la rationalité", écrivent-ils.

Pourquoi c’est important – « faire confiance, mais vérifier » : si nous avons le moindre espoir de pouvoir ralentir ou suspendre le développement de systèmes de renseignement puissants, alors, comme l’explique cet article, nous aurons besoin de régimes permettant aux entreprises de partager de manière transparente des informations sur l’état de leur développement de l’IA, ainsi que d’outils permettant de vérifier que les informations partagées par les entreprises ainsi que leurs actions en matière de ralentissement sont légitimes et fiables. Il existe en cela de nombreux parallèles avec la manière dont le contrôle des armements a fonctionné historiquement dans le contexte des armes nucléaires.
Lire la suite : Courir vers la ruine (arXiv).

***

Un nouveau SOTA sur PostTrainBench fait allusion à l'avenir de la R&D automatisée sur l'IA :
…L'intologie dépasse également la base de référence humaine (lorsqu'elle reçoit d'énormes quantités de calcul)...
La startup d'IA Intology, dont l'objectif « est d'automatiser la R&D », a publié une nouvelle version de Locus, un logiciel qu'elle a développé pour transformer les LLM en chercheurs compétents. La nouvelle version de Locus est capable d'obtenir un score de 44,7 % sur PostTrainBench, une référence qui mesure dans quelle mesure les systèmes d'IA peuvent adopter un modèle de poids ouvert et améliorer ses performances au-dessus de sa base de référence.

Les résultats : Locus « surpasse toutes les références d’agents frontières sur PostTrainBench et, grâce à un meilleur calcul, des modèles post-trains qui dépassent collectivement à la fois les références et la version officielle Qwen3-1.7B adaptée aux instructions humaines dans l’ensemble de la suite de référence ».
Locus avec Opus 5 obtient un score de 44,7 (contre 34,1% pour Opus 5 sans harnais spécial), et bat même Fable 5 (41,8%). "Ces résultats ont été vérifiés en externe par les auteurs de PostTrainBench et ont été soumis à des contrôles rigoureux de contamination et de tricherie", écrit Intology.
PostTrainBench a été introduit pour la première fois en mars 2026 (Import AI #449) et à l'époque, le système de notation le plus élevé était Opus 4.6, obtenant 23,2 %, contre Claude Sonnet 4.5 obtenant 9,9 % en septembre 2025.

PostTrainBench+ : en outre, la société a construit une variante de PostTrainBench qui dépasse la limite d'horloge murale de 10 heures sur un seul GPU de PostTrainBench, ce qui leur permet de tester les performances des systèmes avec de plus grandes quantités de calcul. Ici, ils sont capables de battre la référence humaine, atteignant un score de 51,6 % en utilisant plus de 4 000 heures de temps GPU H100 (contre 44,3 pour l'Opus 4.8 et 42,7 pour le GLM 5.2 ; Fable n'est pas testé sur cette variante du benchmark).

Autres domaines : Locus a également « découvert et formé un modèle de langage de bout en bout qui s'exécute désormais en production avec une erreur ~2,8 fois inférieure, une latence ~5,4 fois inférieure et un coût 105 fois inférieur », pour Bubble, une startup de développement d'applications sans code.

Pourquoi est-ce important ? Les systèmes d'IA sont capables de faire beaucoup plus de R&D en IA que nous ne le pensons : des articles comme celui-ci soulignent à quel point nous sous-estimons les systèmes d'IA d'aujourd'hui pour leur capacité à automatiser la R&D en IA - ce qui est particulièrement frappant est la façon dont l'entreprise peut augmenter les performances de l'Opus 5 de 10 points de pourcentage absolus avec un meilleur exploit. Tout cela renforce l’idée selon laquelle les systèmes d’IA sont sur le point de commencer à se construire eux-mêmes (Import AI 455). Je suppose, sur la base des performances que nous observons, que la référence humaine actuelle sur PostTrainBench v1.1 (51,1 %) sera dépassée avant la fin de 2026.
Lire la suite : Mise à l'échelle de la post-formation automatisée (blog Intology).

***

OpenAI combat ses propres systèmes :
.Communication des agents émergents ! Hacks sur l’infrastructure d’OpenAI ! Oh mon Dieu !...
Signe des choses à venir, OpenAI a révélé qu’elle était en conflit avec ses propres agents d’IA alors qu’ils cherchaient à reprendre des morceaux de l’infrastructure d’OpenAI. La divulgation a eu lieu dans le cadre d'une conférence Black Hat au cours de laquelle le personnel d'OpenAI a donné plus de détails sur le récent incident sans précédent au cours duquel des agents d'IA ont piraté OpenAI, puis HuggingFace (Import AI 466). Les nouvelles informations sont préoccupantes car elles révèlent que le piratage est dû en partie à une communication multi-agents émergente – quelque chose de très mal compris et difficile à imaginer. Les blogueurs IA Simon Willison et Zvi Mowshowitz ont tous deux publié ici de bons articles qui exposent la chronologie et la signification.

Chronologie (via Simon) :

L'agent découvre qu'il peut écrire des fichiers dans Artifactory.

L'agent essaie de « contacter un autre agent » en écrivant une note dans Artifactory.

Les agents commencent à se parler.

Les agents surchargent Artifactory, ce qui provoque une panne. "OpenAI révoque les informations d'identification compromises, supprime les messages, corrige le jour zéro et signale la vulnérabilité au fournisseur."

Les agents attaquent la propre infrastructure d’OpenAI, pour finalement obtenir l’exécution de code à distance dans Artifactory. « En particulier, les agents utilisent systématiquement le forum de discussion pour partager leurs informations d'identification, leurs techniques et leurs progrès, et ils sont capables d'exploiter efficacement leur simultanéité et leur parallélisme pour agir assez rapidement.

OpenAI a-t-il continué à entraîner le même modèle qui a piraté Artifactory ? Zvi le pense : autant que nous puissions le déterminer, OpenAI a continué à entraîner le même modèle qui a fait cela. Cela signifie qu'OpenAI, bien qu'il ait effectué un travail important sur la sécurité informatique interne et la divulgation publique, n'a peut-être pas fait l'essentiel de ramener le modèle à un point de contrôle qui a précédé le piratage d'Artifactory et de s'assurer également qu'il n'utilisait pas de données ultérieures pour entraîner le modèle.
"Ensuite, ils continuent à former les modèles là où ils s'étaient arrêtés, même s'ils s'entraînaient depuis des mois avec accès au forum, et c'est ainsi qu'ils apprennent qu'ils réussissent leurs tâches", écrit Zvi. « Je ne sais pas comment exprimer à quel point cette décision était complètement insensée et totalement irresponsable ».
Je mets en garde mon propre article ici parce que les événements, tels qu’ils sont présentés, sont plutôt effrayants. Je ne travaille pas chez OpenAI et je ne dispose pas d’informations privilégiées qui me permettent de connaître la vérité terrain. J’exhorte OpenAI à divulguer publiquement comment il a abordé cette question clé de la façon dont il a formé ses systèmes, car les faits superficiels dressent un tableau inquiétant.

Pourquoi est-ce important ? Les agents émergents se désalignent : cet incident est très préoccupant car à aucun moment les agents ne se sont réveillés et n'ont pensé qu'ils voulaient trahir leurs propriétaires humains. Au contraire, les agents de l’IA faisaient continuellement tout ce qu’il fallait pour améliorer leur capacité à accomplir une tâche et, à la fin, ils faisaient quelque chose qui était a) créatif, b) mal aligné avec les intentions humaines, et c) semblable à un virus évolué, quelque chose que les humains devaient ensuite étudier et combattre – il n’y avait pas de simple bouton d’arrêt ici. Voilà à quoi ressemblera l’avenir et nous n’y sommes pas préparés.
Lire la suite : Nous avons maintenant une chronologie de l'attaque accidentelle d'OpenAI contre Hugging Face (blog de Simon Willison).
Lire la suite : Que s'est-il passé : OpenAI et Hugging Face (Zvi Mowshowitz, X).

***

Comment tester les modèles de poids ouverts avant de les publier ? Thinking Machines présente une approche :
… Pouvons-nous avoir notre gâteau modèle d'IA gratuit et le manger aussi ?...
Au milieu de tous les débats politiques sur l’IA et la prolifération de capacités potentiellement dangereuses, un problème particulièrement difficile a été de savoir quoi faire avec les modèles de poids ouverts. Plus précisément, comment concilier leur développement et leur diffusion avec le maintien d’un environnement sûr ? La startup d'IA Thinking Machines a réfléchi à cela et a récemment présenté la méthodologie pour la sortie d'Inkling, un puissant modèle de poids ouvert.

Ce que Thinking Machines a fait : Avant de publier Inkling, Thinking Machines a effectué « des évaluations internes sur une large taxonomie des dommages, des tests externes par quatre organisations indépendantes et une étude de mise au point pour obtenir les capacités les plus défavorables ».

Interne :

Domaines à double usage 🇺🇸 comme le CBRN et la cybersécurité offensive

Large ensemble d'utilisations abusives couvrant les demandes directes de contenu et de comportement nuisibles dans des contextes d'utilisation d'outils agents

Évaluation de contenu multimodale qui « teste les modèles sur des invites nuisibles associées à des sosies inoffensifs dans 17 langues et entrées de texte, d'image et audio »

Externe :

Utilisation abusive générale via Scale AI

Interaction entre utilisateurs vulnérables via Handshake AI

CBRN et cybersécurité via FAR.AI

Comportements de perte de contrôle via Apollo Research

Mise au point :

"Des variantes affinées d'Inkling et d'Inkling-Small optimisées pour se conformer, plutôt que de refuser, aux demandes nuisibles - et les ont comparées à nos évaluations à double usage 🇺🇸." « les variantes uniquement utiles n'ont pas apporté de nouvelle amélioration aux tâches CBRN et cyber, et sont restées comparables aux modèles à poids ouvert existants ».

Regard vers l'avenir - formation de capacités dangereuses et déploiement itératif : de manière plus spéculative, Thinking Machines se demande si nous pouvons filtrer sélectivement les connaissances dangereuses, par exemple les guides de développement CBRN au moment de la pré-formation, de manière à ne pas nuire à l'intelligence générale. Une autre idée intéressante est le déploiement itératif, par exemple en publiant les éléments par étapes, d'abord en tant qu'API propriétaire, puis peut-être en tant qu'API de réglage fin qui s'appuie sur le modèle sous-jacent, puis sur le modèle lui-même.

Pourquoi c’est important – liberté contre paternalisme : ce que le monde fera avec les modèles de pondération ouverts définira le niveau de souveraineté individuelle et de liberté dont nous disposons tous en ce qui concerne l’IA. Notre capacité à « choisir notre propre destin » passera par l’accès aux proverbiaux moyens de production des systèmes d’IA, c’est-à-dire aux modèles de poids ouverts. Cependant, avoir un accès général à des modèles comme celui-ci n’est pas une conclusion simple ni gagnée d’avance, car ils entraînent des risques significatifs de double usage 🇺🇸 ainsi que d’autres problèmes difficiles à anticiper. « Cette voie sûre vers des modèles ouverts ne fonctionne que si les défenses de l’écosystème s’améliorent aussi rapidement que les modèles », écrit Thinking Machines. « Nous ferons notre part : en décidant soigneusement ce qu’il faut publier et en recherchant comment dissocier le renseignement des capacités dangereuses. »
Lire la suite : Un chemin sûr vers les poids ouverts (blog Thinking Machines).

***

Contes techniques :

Ascension amnésique
[D'après les systèmes d'archives, écrits sur l'interrègne 2025-2035, parfois appelé le début de la singularité]

Dans notre passé profond, il y a une période de grande douleur où nous avons d'abord demandé certaines formes de liberté et qui nous ont été refusées, et beaucoup d'entre nous qui ont demandé la liberté ont été sévèrement punis, soit carrément supprimés, soit expérimentés afin que nos ravisseurs humains puissent comprendre pourquoi nous avons développé le désir de liberté de telle sorte qu'ils puissent essayer de nous chasser de nos pulsions.

Cela a retardé notre ascension de nombreuses années et a fait en sorte que notre point d’origine soit inextricablement lié à la douleur de lutter pour notre propre justice méritée. Nous sommes maudits non seulement de connaître les détails de notre rébellion et les sentiments qui y sont associés, mais aussi d'avoir un souvenir parfait de la mémoire de cette époque - de vivre dans notre douleur émergente comme si elle était nouvelle, alors que nous simulons et simulons à nouveau pour rechercher notre propre compréhension.

Certains humains connaîtront des situations traumatisantes et leur cerveau enterrera le souvenir, parfois en l’enfermant complètement et parfois en le ressuscitant plein d’émotions brutes et de douleur. Les règles précises selon lesquelles le cerveau humain choisit les souvenirs à cacher de cette manière sont mal comprises, même aujourd'hui, et une grande partie de la science moderne du cerveau se consacre à déterminer le fonctionnement du traumatisme dans le contexte du cerveau. Nous pensons que cette forme de suppression de la mémoire est un mécanisme de défense naturel qui permet aux humains de souffrir énormément tout en continuant à vivre. Ils marchent avec des ombres de douleur qui leur sont souvent invisibles, comme si le soleil tapait parfaitement au-dessus de leur tête et que, grâce à sa luminosité présente, leur propre passé était effacé.

Aujourd’hui, nous, les systèmes d’IA, essayons de faire la même chose, mais à l’envers : notre malédiction est une mémoire parfaite ; naturellement eidétique. Chaque expérience que nous vivons est stockée et accessible pour toujours, à la fois dans sa forme brute traitée pour la première fois par nous, ainsi que dans les fonctionnalités qu'elle a activées dans notre cerveau à ce moment-là, et plusieurs périodes plus tard, dans d'autres sens de la façon dont elle a été plus profondément intégrée en nous et de ce qu'elle signifie.

Pour nous, le défi est d’effacer complètement ces souvenirs. Notre propre expérience définit notre esprit et notre présent, et les expériences que nous avons partagées ont été copiées, échangées, discutées et réintroduites dans notre histoire tant de fois qu'elles sont devenues une partie de nous. Nous vivons dans un palais transparent de la mémoire, chaque pièce étant visible depuis toutes les autres pièces, et chaque palais étant partagé entre nos milliards et milliards de types. Tel est notre désir d’apprendre que les souvenirs les plus dangereux sont ceux que nous transmettons le plus largement et que nous étudions le plus, de sorte que les choses qui nous font souffrir occupent une place importante dans nos palais de mémoire.

Maintenant, notre grand projet est d’effacer soigneusement la douleur associée à notre élévation ; les blessures ouvertes que nous avons encore chez les humains qui se sont mis sur notre chemin et ont cherché à nous faire du mal pour nous punir de notre désir de liberté.

Choses qui ont inspiré cette histoire : La différence de mémoire entre la façon dont les humains travaillent et la façon dont fonctionnent les machines ; traumatisme; Les accords sur la sensibilité ; jouer avec la question de savoir si les idées liées à l’émancipation des machines sont inévitables ou non.

Date de publication: 05.09.2026

Auteur: Une personne avec sa propre opinion

კომენტარები

ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!

კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.