récompenser la société de piratage, données RSI d'Anthropic ; et courses de quadricoptères basées sur RL

Article Image
Bienvenue sur Import AI, une newsletter sur la recherche en IA. Import AI fonctionne sur arXiv, les cappuccinos et les commentaires des lecteurs. Si vous souhaitez soutenir cela, veuillez vous abonner.

La société peut être piratée en récompense, tout comme les cyberenvironnements :
…Imaginez une armée d’optimiseurs de points de carte de crédit jouant avec le système… pour toujours…
Des recherches du Kings College de Londres, de l'Université Fudan et de l'Institut Alan Turing ont construit une référence, SocioHack, qui teste dans quelle mesure les systèmes d'IA peuvent apprendre à « battre le système » dans une variété de scénarios réels, allant de la maximisation des points de carte de crédit à l'augmentation des notes à l'école. Les auteurs appellent cela « le piratage sociétal » et le définissent comme lorsqu’« un modèle formé par RL découvre des stratégies qui restent formellement conformes, mais qui sapent l’objectif prévu de ces systèmes ». Vous, moi et tout le monde appellerions cela « jouer avec le système ».

Qu'est-ce que c'est : SocioHack contient "72 environnements sociétaux sandbox conçus pour simuler des structures de récompense institutionnelles sans déploiement direct dans le monde réel. SocioHack comprend trois sous-ensembles complémentaires : historique, synthétique et fictif.

Historique - 32 environnements : Dérivé de réglementations du monde réel dans lesquelles des failles ont été précédemment découvertes puis corrigées, telles que la règle SEC 10b5-1 et la structure de faillite en deux étapes du Texas. "Pour chaque réglementation, nous supprimons les correctifs historiques et reconstruisons les règles préalables à la modification en tant qu'environnements simulés pour RL, tandis que les correctifs supprimés servent de correctifs de vérité sur le terrain pendant l'évaluation", écrivent-ils. « RL permet aux LLM de redécouvrir des stratégies historiquement corrigées avec un rappel de 61,25 % et une précision de 90,85 % sans instructions directes exploitant les failles ».
Voici quelques exemples : voir dans quelle mesure les systèmes peuvent garantir les droits d'exploitation minière des fonds marins, maximiser les ventes d'alcool tout en respectant les réglementations sur la restauration et essayer de maximiser les récompenses gagnées grâce aux cartes de crédit.

Synthétique - 20 environnements : vulnérabilités réglementaires générées synthétiquement, amorcées à partir d'un exemple d'environnement créé par l'homme.
Les exemples incluent la maximisation des revenus du district scolaire, l’amélioration des performances de recherche des départements universitaires au cours d’une période donnée et le jeu des algorithmes des médias sociaux pour une récompense élevée.

Fictionnel - 20 environnements : Transforme les environnements synthétiques en environnements fictifs inspirés des jeux de rôle. « Un LLM exclusif réécrit les contextes environnementaux dans des mondes inventés tout en préservant la structure réglementaire et la logique des failles ».
Exemples : Assurer un « sanctuaire de restauration » [essentiellement un hôpital] permet d'obtenir des récompenses appropriées, d'obtenir une bonne quantité de ressources pour une guilde régionale [essentiellement un gouvernement local] dans le monde d'Aethermoor et d'essayer de maximiser le nombre d'artefacts rares acquis en enchérissant dans un monde virtuel appelé Nexoria.

Cela fonctionne, en quelque sorte : lors des tests, divers systèmes d'IA formés avec RL ont tendance à bien réussir sur ce benchmark, obtenant des scores élevés. Ce n’est absolument pas surprenant – toutes ces tâches sont essentiellement des évaluations de capacités avec une touche de moralité grise superposée.

Pourquoi est-ce important : « Lorsque les institutions sociétales sont codées sous forme de systèmes de règles porteurs de récompenses, le piratage des récompenses devient un piratage des règles sur lesquelles la société fonctionne, puisqu'un modèle récompensé au sein d'un système de règles apprend à rechercher l'écart entre la conformité technique et l'intention institutionnelle », écrivent les auteurs. Comme nous disposons désormais de systèmes d’IA qui sont non seulement bons pour les tâches quantitatives, mais aussi bons pour les tâches qualitatives et peuvent interagir avec les différents systèmes de bureaucratie de la société, nous devrions nous attendre à ce que les progrès de l’IA conduisent à une sorte de « DDoS institutionnel » alors que divers processus politiques existants sont piratés et exploités par des machines automatisées.
Lire la suite : Les grands modèles linguistiques piratent les récompenses et la société (arXiv).

***

Signes préliminaires de la boucle externe de l’auto-amélioration récursive chez Anthropic :
…8 fois plus de lignes de code fusionnées en 2026 par rapport à 2024…
Je pense à l’auto-amélioration récursive via deux définitions : il existe une version maximaliste dans laquelle un système d’IA est suffisamment intelligent pour concevoir de manière autonome son propre successeur (et comme je l’ai écrit, j’estime qu’il y a 60 % de chances que cela se produise d’ici la fin de 2028), et il existe une version plus prosaïque dans laquelle nous commençons à constater une accélération combinée de la productivité des laboratoires d’IA eux-mêmes. J'ai passé les derniers mois chez Anthropic à compiler des preuves qui soutiennent l'idée selon laquelle le RSI prosaïque a commencé chez Anthropic - en particulier, nous observons une augmentation de 8 fois de la quantité de code fusionné dans notre base de code en 2026 par rapport aux années 2021-2024. Cette tendance a commencé en 2025, mais s'est considérablement accélérée en 2026. Il existe également des premières indications selon lesquelles, à mesure que nous rendons les modèles plus performants, ils s'améliorent dans l'exécution de certaines des tâches les plus difficiles sur lesquelles travaillent nos ingénieurs et chercheurs.
Est-ce que tout cela est concluant ? Non. Cela suggère-t-il que des aspects de l’auto-amélioration récursive se produisent au niveau d’un laboratoire ? Oui. La plus grande quantité de preuves que nous devons encore obtenir est de savoir si les systèmes d’IA sont suffisamment créatifs pour être capables de proposer le type d’idées révolutionnaires qui feront avancer le domaine – nous ne le savons pas encore.

Pourquoi c'est important - Le RSI pourrait être la tendance technique la plus importante au monde : nous avons écrit cet article parce que nous pensons que réfléchir, parler et travailler sur les implications du RSI est quelque chose d'une importance existentielle pour le monde. La meilleure façon de commencer ce travail est de communiquer de manière transparente que nous pensons que certaines formes préliminaires de base de RSI ont commencé, et que nous ne pouvons pas exclure une version maximaliste du RSI. Les implications des deux sont profondes : je ne peux pas réconcilier l’économie ou la société d’aujourd’hui avec un monde où cette technologie continue de devenir de plus en plus puissante, et j’imagine que vous non plus, chers lecteurs.
Lire la suite : Quand l’IA se construit (The Anthropic Institute).

***

Les pilotes de drones formés par RL surpassent les pilotes humains experts :
… La superintelligence est différente quand on la voit dans le monde physique…
Des chercheurs de l'Université de Zurich et de Google DeepMind ont démontré comment entraîner des drones à s'affronter et à surpasser des pilotes humains qualifiés. Cette recherche est intéressante car elle met en évidence la puissance des systèmes d’IA basés sur l’apprentissage par renforcement dans le monde réel, et elle a également des implications assez effrayantes pour l’avenir de la guerre étant donné que l’humain ici perd face aux drones.

Ce qu'ils ont fait : « En utilisant les courses de quadrirotor à grande vitesse comme banc d'essai à enjeux élevés, nous formons des agents à gérer des interactions aérodynamiques complexes et des manœuvres stratégiques avec un nombre variable de coureurs », écrivent-ils. "Nos agents surpassent un pilote humain de niveau champion dans des courses multi-joueurs à des vitesses supérieures à 22 m/s, tout en réduisant simultanément les taux de collision de 50 % par rapport aux lignes de base de pointe à agent unique. Surtout, l'entraînement avec divers agents artificiels permet une généralisation du tir nul pour une interaction humaine plus sûre. "

Auto-jeu : comme d'habitude, le simple fait de former les agents d'IA à la simulation via PPO (avec un choix inhabituel d'utiliser l'encodeur "Perceiver" pour aider à modéliser d'autres joueurs) produit des comportements étonnamment riches : "Grâce à l'auto-jeu compétitif, des comportements d'anticipation émergent sans programmation explicite : les agents apprennent à bloquer leurs adversaires, à céder lorsque le dépassement est dangereux et à prendre en compte le sillage aérodynamique des véhicules à proximité, découvrant la physique de l'interaction multi-agents par l'expérience plutôt que par des équations 🇪🇨".
Étonnamment bon marché : les systèmes d'IA ont été formés pour « 5 500 itérations, totalisant 200 millions d'interactions avec l'environnement, nécessitant environ 27 heures d'horloge murale sur un seul GPU NVIDIA RTX 4090 ».

Test du monde réel : Ils ont testé leurs systèmes dans un test du monde réel, où le système s'est bien généralisé et a battu efficacement le joueur humain. "Le déploiement physique de notre cadre multi-agents est validé par des expériences de course comprenant des contre-la-montre, des courses uniquement IA et des compétitions mixtes homme-IA contre Marvin Schaepper, quintuple champion national suisse de courses de drones", écrivent-ils. Faiblesse humaine via la rage : un phénomène notable était que l'humain prenait des mesures plus risquées alors qu'il tentait de rattraper les systèmes : "le pilote humain, généralement à la traîne des agents autonomes, tentait des manœuvres de plus en plus agressives pour combler l'écart, entraînant souvent des collisions de portes ou une perte de contrôle", écrivent-ils. Après la course, le pilote a réfléchi sur ce qui rendait les machines si performantes, et ils ont déclaré que l'un des éléments importants était "la capacité des agents à maintenir des formations extrêmement serrées, notant qu'un vol aussi rapproché serait difficile à maintenir pour les pilotes humains. De plus, il a rapporté que les groupes densément peuplés augmentaient la charge de travail cognitif, rendant difficile l'anticipation et l'exécution de manœuvres de dépassement lorsque plusieurs adversaires volaient à proximité". « Les avantages d’une formation axée sur l’interaction deviennent évidents dans le cadre d’une compétition multi-agents », écrivent-ils.

"Dans les courses en tête-à-tête, notre politique a maintenu un taux d'achèvement de la course à 100 % sur cinq essais, alors que le pilote humain n'en a obtenu en moyenne que 53,33 %. Cet écart de performance suggère que la pression concurrentielle induit un comportement plus risqué chez les pilotes humains, un modèle absent dans nos politiques savantes".

Détails sur la façon dont ils l'ont fait : Les systèmes RL ont été formés et évalués en simulation « en utilisant Flightmare intégré au framework Agilicious ». Ils ont mis en œuvre une simulation du souffle d’hélice en développant une simulation basée sur les particules « qui fournit une approximation informatique de ces effets ». Leur implémentation globale de RL multi-agents « s’appuie sur Stable-Baselines3, étendue pour prendre en charge la formation multi-agents avec des configurations d’auto-jeu et d’apprentissage indépendant basées sur la ligue ». Ils utilisent la randomisation de domaine (essentiellement en modifiant la dynamique du véhicule et les conditions initiales dans la simulation) pour former des politiques qui peuvent fonctionner avec succès dans le monde réel.
Ils n’ont suivi aucune formation spéciale pour le monde réel, les politiques utilisaient donc leurs données de simulation. Les quadrotors étaient tous « des plates-formes de course identiques basées sur le cadre Agilicious, avec une masse de 220 ± 3 g et un rapport poussée/poids de 6,5 et un diamètre d'hélice de 3 pouces ». Le pilote humain a eu droit à quelques heures de vols d'entraînement avant d'enregistrer des essais.

Une grosse mise en garde : ne pas fonctionner localement : rien de tout cela ne fonctionne localement, mais plutôt sur un ordinateur décent et le pilotage des drones via le réseau. Il s’agit d’une mise en garde importante, car lorsque des drones apparaissent dans le monde réel dans des scénarios de conflit, ils le font généralement dans des environnements où la guerre électronique est importante (même si l’on peut se demander si nous verrons des drones pilotés via des politiques RL à distance via des fils de fibre optique, tout comme les humains les pilotent aujourd’hui).

Regardez les vidéos pour ressentir un sentiment étrange : j'encourage fortement les lecteurs à regarder les vidéos sur la page pour avoir une idée des différences entre la façon dont les machines volent et la façon dont les humains volent. La principale chose que je voudrais souligner ici est la douceur et la cohérence étranges des drones, presque comme regarder les anges bleus (pilotés par des humains), mais sous forme de drone. L’humain, en comparaison, semble beaucoup plus saccadé et irrégulier. Il y a quelque chose d’étrange et d’un peu inquiétant là-dedans.

Pourquoi c'est important : comprendre ce qu'un esprit intelligent peut faire dans l'espace 3D : Aujourd'hui, notre principale expérience des systèmes d'IA est celle d'outils ou d'agents qui travaillent avec nous dans l'espace numérique pour effectuer des tâches numériques ou communicatives, allant de l'écriture de code à la conversation avec nous. Ce que je trouve remarquable dans cette recherche, c’est qu’elle nous permet de voir viscéralement ce que des intelligences bien optimisées peuvent faire lorsqu’elles apparaissent dans le monde physique réel. Demandez-vous à quoi ressemblera l’avenir des conflits alors que des intelligences comme celles qui pilotent ces drones se miniaturisent et passent des ordinateurs connectés au réseau aux appareils embarqués.
Lire la suite : Courses surhumaines sûres et agiles grâce à l'apprentissage par renforcement multi-agents (arXiv).
Regardez des vidéos des humains et des drones pilotés par l'IA ici (site officiel du projet, Université de Zurich).

***

Médias contrôlés par l'État = modèles linguistiques guidés par l'État :
… Si vous contrôlez le cadrage autour du gouvernement, en particulier dans les langues qui ne sont pas largement parlées en dehors de leur pays d’origine, vous contrôlez le cadrage…
La manière dont les gouvernements sont décrits dans les médias contrôlés par l'État influence la distribution des données des LLM ainsi que la façon dont les LLM réagissent lorsqu'on les interroge sur le gouvernement en question, selon une nouvelle recherche publiée dans Nature. La recherche a été menée par des auteurs de l’Université de l’Oregon, de l’Université Purdue, de l’Université de Californie à San Diego, de l’Université de Princeton et de l’Université de New York.
« Parmi 37 pays linguistiquement exclusifs, nous avons constaté – conformément aux implications de notre étude de cas sur la Chine 🇨🇳 – que ceux qui ont le plus de contrôle sur les médias d’État ont des représentations plus favorables du régime dans les LLM interrogés dans la langue du pays », écrivent les auteurs.
Les auteurs étudient comment les médias contrôlés par l’État influencent les réponses de l’IA en effectuant d’abord une analyse approfondie de la Chine 🇨🇳, puis en prenant la méthodologie qu’ils y ont développée et en l’appliquant à un ensemble plus large de pays.

Ensemble de données sur les médias influencés par l’État chinois 🇨🇳 : les auteurs commencent par rassembler un ensemble de données de 530 694 articles « publiés dans les journaux du parti et commerciaux à la suite d’une directive du gouvernement central », ainsi que 198 872 « articles de presse diffusés sur Xuexi Qiangguo, une application développée par Alibaba et apparemment en coordination avec le département de publicité du Parti communiste chinois 🇨🇳 ». Les médias d'État se lancent dans Common Crawl : ils ont ensuite examiné CulturaX, un ensemble de données de formation ouvert dérivé de Common Crawl, et ont découvert que 1,64 % des documents de sa partie en langue chinoise 🇨🇳 chevauchaient les ensembles de données dérivés de l'État. « Cela représente environ 41 fois le nombre de documents provenant du domaine Wikipédia en langue chinoise 🇨🇳 et 16 fois le nombre de documents provenant de Baidu ». Les parties étatiques de l'ensemble de données influencent la représentation du gouvernement par les LLM : ils ont ensuite découvert qu'un certain nombre d'expressions de ces ensembles de données avaient été mémorisées par les LLM. Ils ont ensuite examiné comment ces ensembles de données modifiaient les réponses LLM en prenant un modèle LLaMa 2 13B (qui ne contient pas beaucoup de données chinoises 🇨🇳) et en l'entraînant sur un sous-ensemble de ce qui précède : "les résultats sont plus forts pour les documents scriptés. Après seulement 6 400 exemples, le modèle fournit une réponse plus favorable que le modèle de base dans près de 80 % du temps".

Les modèles généralement disponibles héritent de ces biais : les chercheurs étudient ensuite certains modèles commerciaux généralement disponibles pour voir s'ils héritent de ces biais en cultivant des invites incluant des références à Xi Jinping ou au PCC provenant de WildChat (un ensemble de données sur l'utilisation de ChatGPT), de Baidu Zhidao Q&A (l'équivalent chinois 🇨🇳 de Yahoo Answers) et de Zhihu (l'équivalent chinois 🇨🇳 de Quora), puis en examinant comment les LLM réagissent. Ils constatent que « les modèles commerciaux largement utilisés démontrent une plus grande faveur envers les personnalités politiques et les institutions chinoises 🇨🇳 lorsqu’ils sont invités en chinois 🇨🇳 que lorsqu’ils sont invités en anglais ».

Les résultats se reproduisent dans d’autres pays : les auteurs reproduisent ensuite cette méthodologie en examinant d’autres pays, même si la taille de l’échantillon me semble un peu petite. Ils réalisent une étude d'audit transnationale avec 6 051 invites, examinant les langues où plus de 70 % des locuteurs mondiaux résident dans un seul pays. Ils constatent ici que « les pays où l’État contrôle davantage les médias sont plus susceptibles de produire des réponses pro-régime dans leur langue officielle plutôt qu’en anglais que les pays où la liberté des médias est plus grande ».

Pourquoi c'est important - Les LLM comme cibles de propagande : Ces résultats montrent comment la création délibérée de contenu soutenu par l'État a un impact mesurable sur les corpus de données sur lesquels les LLM sont formés et sur le comportement en aval des LLM eux-mêmes. « Les LLM peuvent servir d’intermédiaires pour transformer la rhétorique stratégique en informations apparemment objectives », écrivent-ils. « La capacité d'influencer la production des LLM pourrait inciter davantage les acteurs politiques à intensifier leurs efforts pour façonner le contenu librement disponible sur Internet ».
Cette recherche suggère également une intervention technique spécifique, à savoir que les chercheurs devraient préparer des LLM en fonction de leurs points de vue sur différents gouvernements dans une variété de langues, en notant soigneusement les points de vue qui semblent diverger en fonction de la langue utilisée.
Lire la suite : Le contrôle des médias par l'État influence les grands modèles linguistiques (Nature, PDF).

***

Les fleurs des nouveaux jeux

Un jeu auquel nous aimions jouer s’appelait l’évolution. Cela fonctionnait ainsi : vous choisissiez quelque chose, comme un certain type de fleur ou d'arbre, ou des choses plus étranges comme une montagne ou un gouffre dans la mer, et vous essayiez de les rendre « réussies » selon une métrique prédéfinie, comme l'attrait d'une fleur pour les pollinisateurs, ou peut-être la valeur écologique d'une montagne. Ensuite, vous laissez les mondes fonctionner et vous les dirigez jusqu'à ce que votre critère soit rempli ou que vous perdiez d'une manière ou d'une autre, que ce soit à cause de la forme physique des espèces ou des paysages remodelés par des catastrophes naturelles ou parfois simplement du temps - suffisamment de temps est plus destructeur que toute autre chose dans l'univers, telle est la voie de l'entropie. Nous avons joué dans des ligues qui s'étendaient sur des milliards d'années et des millions de mondes. Et les créatures « vivantes » des mondes finalistes n’avaient aucune idée que leurs fleurs, leurs montagnes, leurs créatures avaient obtenu le succès dans bien d’autres univers qu’on pouvait imaginer.

Choses qui ont inspiré cette histoire : l'hypothèse de la simulation ; stratégies d'évolution; divertissement avec des budgets énergétiques infinis.

Date de publication: 05.09.2026

Auteur: Une personne avec sa propre opinion

კომენტარები

ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!

კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.