Добро пожаловать в Import AI, информационный бюллетень об исследованиях в области ИИ. Импорт ИИ работает на arXiv, капучино и отзывах читателей. Если вы хотите поддержать это, пожалуйста, подпишитесь.
Общество можно взломать за вознаграждение, как и киберсреду:
…Представьте себе армию оптимизаторов кредитных карт, играющих в систему… вечно…
Исследования Королевского колледжа Лондона, Университета Фудань и Института Алана Тьюринга создали тест SocioHack, который проверяет, насколько хорошо системы искусственного интеллекта могут научиться «побеждать систему» в различных реальных сценариях, начиная от максимизации баллов по кредитным картам и заканчивая завышением оценок в школе. Авторы называют это «социальным взломом» и определяют его как когда «модель, обученная RL, обнаруживает стратегии, которые остаются формально совместимыми, но подрывают предполагаемую цель этих систем». Вы, я и все остальные назвали бы это просто «игрой в систему».
Что это такое: SocioHack содержит "72 социальных среды-песочницы, предназначенных для моделирования институциональных структур вознаграждения без прямого развертывания в реальном мире. SocioHack включает в себя три взаимодополняющих подмножества: историческое, синтетическое и вымышленное".
Исторические — 32 среды: основаны на реальных правилах, в которых лазейки были ранее обнаружены и впоследствии исправлены, например, правило SEC 10b5-1 и двухэтапная структура банкротства Техаса. «Для каждого правила мы удаляем исторические исправления и реконструируем правила, существовавшие до внесения поправок, как моделируемые среды для RL, в то время как удаленные исправления служат в качестве исправлений для проверки достоверности во время оценки», — пишут они. «RL позволяет LLM заново открывать исторически исправленные стратегии с полнотой 61,25% и точностью 90,85% без прямых инструкций по использованию лазеек».
Некоторые примеры здесь включают в себя наблюдение за тем, насколько хорошо системы могут обеспечить права на добычу полезных ископаемых на дне океана, максимизацию продаж алкоголя при работе в рамках правил общественного питания и попытки максимизировать вознаграждения, получаемые с помощью кредитных карт.
Синтетические — 20 сред: синтетически созданные нормативные уязвимости, полученные из образца среды, созданного человеком.
Примеры включают максимизацию доходов школьного округа, улучшение исследовательской деятельности факультетов университета в течение определенного периода и использование алгоритмов социальных сетей для получения высокого вознаграждения.
Вымышленная — 20 сред: превращает синтетическую среду в вымышленную, вдохновленную ролевыми играми. «Запатентованная программа LLM переписывает условия окружающей среды в придуманные миры, сохраняя при этом нормативную структуру и логику лазеек».
Примеры: обеспечение «восстановительного святилища» [по сути, больницы] для получения соответствующих наград, получение большого количества ресурсов для региональной гильдии [по сути, местного правительства] в мире Этермура и попытка максимизировать количество приобретаемых редких артефактов путем торгов в виртуальном мире под названием Нексория.
В каком-то смысле это работает: в тестах различные системы искусственного интеллекта, обученные с помощью RL, как правило, хорошо справляются с этим тестом, получая высокие оценки. Это совершенно неудивительно — все эти задачи, по сути, представляют собой оценку возможностей с некоторой долей серой морали поверх них.
Почему это важно: «Когда социальные институты закодированы как системы правил, приносящие вознаграждение, взлом за вознаграждение становится взломом правил, по которым действует общество, поскольку модель, вознаграждаемая внутри системы правил, учится искать разрыв между техническим соответствием и институциональными намерениями», — пишут авторы. Поскольку теперь у нас есть системы ИИ, которые не только хороши в количественных, но и в качественных задачах и могут взаимодействовать с различными системами бюрократии общества, мы должны ожидать, что достижения ИИ приведут к своего рода «институциональным DDoS», поскольку различные существующие политические процессы будут взломаны и использованы автоматизированными машинами.
Подробнее: Большие языковые модели Hack Rewards и Society (arXiv).
***
Предварительные признаки внешнего цикла рекурсивного самосовершенствования в Anthropic:
…8-кратное увеличение количества строк кода, объединенных в 2026 году, по сравнению с 2024 годом…
Я рассматриваю рекурсивное самосовершенствование с помощью двух определений: есть максималистская версия, когда система ИИ достаточно умна, чтобы самостоятельно спроектировать своего собственного преемника (и, как я уже писал, по моим оценкам, вероятность того, что это произойдет к концу 2028 года, составляет 60%), и есть более прозаическая версия, в которой мы начинаем видеть совокупное увеличение производительности самих лабораторий ИИ. Последние несколько месяцев я провел в Anthropic, собирая некоторые доказательства, подтверждающие идею о том, что прозаический RSI начался в Anthropic — в частности, мы наблюдаем 8-кратное увеличение количества кода, объединенного в нашу кодовую базу в 2026 году по сравнению с 2021-2024 годами. Эта тенденция началась в 2025 году, но значительно ускорилась в 2026 году. Есть также первые признаки того, что по мере того, как мы делаем модели более функциональными, они лучше справляются с некоторыми из более сложных задач, над которыми работают наши инженеры и исследователи.
Является ли это окончательным? Нет. Можно ли предположить, что аспекты рекурсивного самосовершенствования происходят на уровне лаборатории? Да. Самый большой объем доказательств, которые нам еще предстоит получить, заключается в том, являются ли системы искусственного интеллекта достаточно креативными, чтобы быть в состоянии предлагать идеи, меняющие парадигму, которые продвигают эту область вперед - мы этого пока не видим.
Почему это важно — RSI может быть самой важной технической тенденцией в мире: мы написали этот пост, потому что ожидаем, что размышления, разговоры и работа над последствиями RSI имеют экзистенциальную важность для мира. Лучший способ начать эту работу — открыто сообщить, что, по нашему мнению, уже начались некоторые базовые, предварительные формы RSI, и мы не можем исключать максималистскую версию RSI. Последствия того и другого глубоки: я не могу совместить сегодняшнюю экономику или общество с миром, в котором эти технологии продолжают становиться все более мощными, и я ожидаю, что и вы, дорогие читатели, не сможете.
Подробнее: Когда ИИ строит себя (Антропный институт).
***
Обученные RL пилоты-дроны превосходят опытных пилотов-человеков:
…Сверхинтеллект ощущается по-другому, когда вы видите его в физическом мире…
Исследователи из Цюрихского университета и Google DeepMind продемонстрировали, как научить дроны соревноваться друг с другом и превосходить опытных пилотов-людей. Это исследование интересно тем, что оно одновременно подчеркивает, насколько мощными становятся системы искусственного интеллекта, основанные на обучении с подкреплением, в реальном мире, а также имеет некоторые довольно пугающие последствия для будущего войны, учитывая, что люди здесь проигрывают дронам.
Что они сделали: «Используя высокоскоростные гонки на квадроциклах в качестве испытательного стенда с высокими ставками, мы обучаем агентов управлять сложными аэродинамическими взаимодействиями и стратегическим маневрированием с переменным количеством гонщиков», — пишут они. "Наши агенты превосходят пилотов-человеков чемпионского уровня в многопользовательских гонках на скоростях, превышающих 22 м/с, одновременно снижая частоту столкновений на 50 % по сравнению с современными базовыми показателями для одного агента. Крайне важно, что обучение с использованием различных искусственных агентов позволяет проводить обобщение с нулевым выстрелом для более безопасного взаимодействия между людьми".
Самостоятельная игра: Как обычно, простое обучение ИИ-агентов симуляции с помощью PPO (с одним необычным выбором использования кодировщика «Perceiver» для помощи в моделировании других игроков) приводит к удивительно богатому поведению: «Благодаря конкурентной самостоятельной игре упреждающее поведение проявляется без явного программирования: агенты учатся блокировать противников, уступать, когда обгон небезопасен, и учитывать аэродинамический след ближайших транспортных средств, открывая физику межагентного взаимодействия на опыте, а не на основе уравнений».
На удивление дешево: системы искусственного интеллекта были обучены «5500 итерациям, в общей сложности 200 миллионов взаимодействий с окружающей средой, что потребовало примерно 27 часов настенного времени на одном графическом процессоре NVIDIA RTX 4090».
Испытание в реальном мире: они протестировали свои системы в реальных испытаниях, где система хорошо обобщалась и эффективно побеждала игрока-человека. «Физическое развертывание нашей мультиагентной структуры подтверждается гоночными экспериментами, включающими гонки на время, гонки только с участием ИИ и смешанные соревнования между человеком и ИИ против Марвина Шеппера, пятикратного национального чемпиона Швейцарии по гонкам дронов», — пишут они. Человеческая слабость через ярость. Одним из примечательных явлений было то, что люди предпринимали более рискованные действия, пытаясь догнать системы: «пилот-человек, обычно преследующий автономных агентов, предпринимал все более агрессивные маневры, чтобы сократить разрыв, что часто приводило к столкновениям с воротами или потере контроля», — пишут они. После гонки пилот задумался о том, что сделало машины такими хорошими, и они сказали, что важным моментом является "способность агентов поддерживать чрезвычайно плотный строй, отметив, что пилотам-людям будет трудно выдержать такой полет на близком расстоянии. Кроме того, он сообщил, что плотно упакованные группы увеличивают когнитивную нагрузку, что затрудняет предвидение и выполнение маневров обгона, когда несколько противников летят в непосредственной близости". «Преимущества обучения с учетом взаимодействия становятся очевидными в условиях конкуренции между несколькими агентами», — пишут они.
"В гонках один на один наша политика обеспечивала 100% завершение гонки в пяти испытаниях, в то время как пилот-человек набирал в среднем только 53,33%. Этот разрыв в производительности предполагает, что конкурентное давление вызывает более рискованное поведение у пилотов-людей, чего нет в нашей изученной политике".
Подробности о том, как они это сделали: Системы RL были обучены и оценены в моделировании «с использованием Flightmare, интегрированного с инфраструктурой Agilicious». Они реализовали моделирование потока гребного винта, разработав моделирование на основе частиц, «которое обеспечивает вычислительную аппроксимацию этих эффектов». Их общая реализация многоагентного RL «основана на Stable-Baselines3, расширенной для поддержки многоагентного обучения с самостоятельной игрой на основе лиг и независимыми конфигурациями обучения». Они используют рандомизацию области (по сути, изменяя динамику транспортного средства и начальные условия в моделировании) для обучения политикам, которые могут успешно работать в реальном мире.
Они не проводили никакой специальной подготовки для реального мира, поэтому политики использовали данные моделирования. Все квадрокоптеры представляли собой «идентичные гоночные платформы на базе Agilicious, с массой 220 ± 3 г, тяговооружённостью 6,5 и диаметром пропеллера 3 дюйма». Пилоту-человеку дали пару часов тренировочных полетов перед зарегистрированными испытаниями.
Одно большое предостережение — не работает локально: ничто из этого не работает локально, скорее, оно работает на приличном компьютере и управляет дронами через сеть. Это важное предостережение, поскольку, когда дроны появляются в реальном мире в сценариях конфликтов, они обычно делают это в средах со значительным количеством радиоэлектронной борьбы (хотя возникает вопрос, увидим ли мы дроны, управляемые с помощью политик удаленного RL по оптоволоконному кабелю, точно так же, как люди управляют ими сегодня).
Посмотрите видео, чтобы почувствовать жуткое ощущение: я настоятельно рекомендую читателям просмотреть видеоролики на странице, чтобы почувствовать разницу между тем, как летают машины, и тем, как летают люди. Главное, что я хотел бы здесь подчеркнуть, — это жуткая плавность и слаженность работы дронов, почти как наблюдение за синими ангелами (пилотируемыми человеком), но в форме дронов. Человек, по сравнению с ним, кажется гораздо более нервным и неустойчивым. Есть в этом что-то странное и немного тревожное.
Почему это важно — понимание того, что умный разум может делать в трехмерном пространстве: Сегодня наш основной опыт работы с системами ИИ — это инструменты или агенты, которые работают с нами в цифровом пространстве для выполнения цифровых или коммуникативных задач, начиная от написания кода и заканчивая общением с нами. Что мне кажется примечательным в этом исследовании, так это то, что оно позволяет нам интуитивно увидеть, на что способен хорошо оптимизированный интеллект, когда он появляется в реальном физическом мире. Спросите себя, как будет выглядеть будущее конфликтов, когда интеллект, подобный тем, которые пилотируют эти дроны, станет миниатюрным и перейдет с подключенных к сети компьютеров на бортовые устройства.
Подробнее: Сверхчеловеческие безопасные и маневренные гонки посредством многоагентного обучения с подкреплением (arXiv).
Посмотреть видео о людях и дронах, управляемых искусственным интеллектом, можно здесь (официальный сайт проекта, Цюрихский университет).
***
Контролируемые государством СМИ = управляемые государством языковые модели:
…Если вы контролируете структуру вокруг правительства, особенно на языках, на которых мало говорят за пределами их родной страны, вы контролируете структуру…
Согласно новому исследованию, опубликованному в журнале Nature, то, как правительства описываются в контролируемых государством СМИ, влияет на распространение данных LLM, а также на то, как LLM реагируют на вопросы о соответствующем правительстве. Исследование провели авторы из Университета Орегона, Университета Пердью, Калифорнийского университета в Сан-Диего, Принстонского университета и Нью-Йоркского университета.
«Среди 37 стран с исключительным языком общения мы обнаружили — что согласуется с выводами из нашего тематического исследования в Китае 🇨🇳 — что страны с более сильным контролем государственных СМИ имеют более благоприятное изображение режима в магистратурах, задаваемых на языке страны», — пишут авторы.
Авторы изучают, как контролируемые государством СМИ влияют на реакцию ИИ, сначала глубоко изучая Китай 🇨🇳, а затем взяв разработанную там методологию и применив ее к более широкому кругу стран.
Набор данных китайских 🇨🇳 СМИ, находящихся под влиянием государства: авторы начинают с сбора набора данных из 530 694 статей, «опубликованных в партийных и коммерческих газетах в результате директивы центрального правительства», а также 198 872 «новостных статей, распространяемых через Xuexi Qiangguo, приложение, разработанное Alibaba и, как сообщается, в координации с отделом рекламы Коммунистической партии Китая 🇨🇳». Государственные СМИ перешли к Common Crawl: затем они изучили CulturaX, открытый обучающий набор данных, полученный из Common Crawl, и обнаружили, что 1,64% документов из его китайскоязычной 🇨🇳 части пересекаются с наборами государственных данных. «Это примерно в 41 раз превышает количество документов, поступающих из китайскоязычного 🇨🇳 домена Википедии, и в 16 раз больше количества документов, поступающих из Baidu». Части набора данных о штатах влияют на изображение правительства LLM: затем они обнаружили, что несколько фраз из этих наборов данных были запомнены LLM. Затем они изучили, как эти наборы данных изменили ответы LLM, взяв модель LLaMa 2 13B (в которой не так много данных на китайском 🇨🇳 языке) и обучив ее на подмножестве приведенных выше: "результаты самые сильные для скриптовых документов. Всего лишь после 6400 примеров модель дает более благоприятный ответ, чем базовая модель, почти в 80% случаев".
Общедоступные модели наследуют эти предубеждения: затем исследователи изучают некоторые общедоступные коммерческие модели, чтобы увидеть, наследуют ли они эти предубеждения, обрабатывая подсказки, включающие ссылки на Си Цзиньпина или КПК из WildChat (набор данных об использовании ChatGPT), Baidu Zhidao Q&A (китайский 🇨🇳 эквивалент Yahoo Answers) и Zhihu (китайский 🇨🇳 эквивалент Quora), а затем наблюдая за тем, как реагируют LLM. Они обнаружили, что «широко используемые коммерческие модели демонстрируют большую благосклонность к китайским 🇨🇳 политическим деятелям и институтам, когда им подсказывают на китайском 🇨🇳 языке, чем когда им подсказывают на английском 🇬🇧».
Результаты повторяются и в других странах: затем авторы повторяют эту методологию, рассматривая другие страны, хотя размер выборки мне кажется немного маленьким. Они проводят межнациональное аудиторское исследование с 6051 запросом, рассматривая языки, на которых более 70% говорящих по всему миру проживают в одной стране. Здесь они обнаружили, что «страны с более сильным контролем государственных СМИ с большей вероятностью будут давать проправительственные ответы на своем официальном языке, а не на английском 🇬🇧, чем страны с большей свободой СМИ».
Почему это важно: LLM как цель пропаганды: эти результаты показывают, как преднамеренное создание государственного контента оказывает измеримое влияние на массивы данных, на которых обучаются LLM, и на дальнейшее поведение самих LLM. «LLM могут служить посредниками, которые превращают стратегическую риторику в, казалось бы, объективную информацию», — пишут они. «Возможность влиять на результаты LLM может еще больше стимулировать политических деятелей расширять свои усилия по формированию контента, свободно доступного в Интернете».
Это исследование также предполагает конкретное техническое вмешательство, которое заключается в том, что исследователи должны собрать в команду студентов-магистров права, чтобы узнать их взгляды на различные правительства на разных языках, тщательно отмечая, когда взгляды расходятся, по-видимому, в зависимости от того, какой язык используется.
Подробнее: Государственный контроль над СМИ влияет на большие языковые модели (Природа, PDF).
***
Цветы новых игр
Одна игра, в которую мы любили играть, называлась «Эволюция». Это работало следующим образом: вы собирали что-то, например, цветок определенного типа или дерево, или более странные вещи, например, гору или морскую пропасть, и пытались сделать их «успешными» в соответствии с какими-то заранее заданными показателями, например, привлекательностью цветка для опылителей или, возможно, экологической пригодностью горы. Затем вы позволяете мирам управляться и управляете ими до тех пор, пока ваш критерий не будет выполнен или вы не проиграете каким-либо образом, будь то из-за приспособленности видов или изменения ландшафтов в результате стихийных бедствий, а иногда просто из-за времени - достаточное количество времени более разрушительно, чем что-либо еще во вселенной, таков путь энтропии. Мы играли в лигах, охватывающих миллиарды лет и миллионы миров. И «живые» существа в мирах-финалистах понятия не имели, что их цветы, их горы, их создания добились успеха во многих других вселенных, чем можно было себе представить.
Вещи, которые вдохновили эту историю: Гипотеза симуляции; стратегии эволюции; развлечения, учитывая бесконечные энергетические ресурсы.
вознаграждение хакерского сообщества, данные RSI от Anthropic; и гонки на квадрокоптерах на базе RL

კომენტარები
ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!
კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.