Welcome to Import AI, a newsletter about AI research. Import AI runs on arXiv, cappuccinos, and feedback from readers. If you’d like to support this, please subscribe.
Want to be able to deal with RSI? Here are 23 actionable policy ideas:
…IFP serves up some “low-regret” policy recommendations…
Policy experts with think tank IFP have published a set of ideas meant to help “policymakers begin addressing the risks of further automating AI R&D”. The recommendations involve 23 specific ideas falling across 7 specific categories. If adopted, these recommendations would also give countries, especially the United States, more moves they can make on the gameboard as powerful systems are developed, ideally giving them the ability to:
Accelerate “the diffusion of AI capabilities, by allocating compute and talent towards inference and the development of new AI applications”.
Accelerate “R&D to make further AI research automation safer, either by improving model safety directly or by boosting societal resilience”.
Seven categories of idea:
“Provide transparency into automated AI R&D
Improve state capacity to understand and respond to automated AI R&D
Develop a risk management strategy for automated AI R&D that accelerates defensive and commercial AI uses
Accelerate the development of AI verification technology
Invest in AI resilience
Расширьте лидерство США 🇺🇸 в области ИИ, чтобы дать США 🇺🇸 больше времени для управления рисками автоматизации исследований и разработок в области ИИ.
Создайте дополнительную ценность для международного сотрудничества по управлению рисками автоматизированных исследований и разработок в области искусственного интеллекта».
Почему это важно – чем меньше у нас вариантов борьбы с RSI, тем хуже будут результаты: прямо сейчас мир продвигает разработку ИИ в автомобиле, у которого есть только педаль акселератора и нет педали тормоза, не говоря уже о какой-либо сложной телеметрии для получения информации о самых разных вещах, от скорости автомобиля до свойств двигателя и износа шин. Подобные предложения от IFP позволят создать больше пресловутых педалей и сенсорных систем для транспортных средств индустрии искусственного интеллекта, а это значит, что если нам понадобится изменить курс или замедлить ход, у нас будет больше возможностей сделать это в момент кризиса.
Читать далее: Как США 🇺🇸 следует подготовиться к более автоматизированным исследованиям и разработкам в области искусственного интеллекта? (ИФП).
***
Небольшой рассказ из Фив об умных машинах и телах роботов:
…Каково может быть взаимодействие с ИИ во время взлета?…
Вот забавная короткая художественная история из Фив (@voooooogel на X) о том, как кто-то из будущего посетил сайт, управляемый мощной системой искусственного интеллекта. В этой истории представлены идеи о паузах ИИ, рекурсивном самосовершенствовании, о том, что означает, что системы ИИ начинают выполнять действия в экономике в целом, и о том, как мы, люди, можем рассуждать о умных машинах или доверять им. Прочтите это!
Прочтите историю здесь: Приход нового солнца (ВГЭЛ, сайт).
***
Два ингредиента успешного замедления роста среди конкурирующих фирм, занимающихся ИИ: доверие и прозрачность:
…Анализ теории игр предполагает, что замедление возможно…
Исследователи из Массачусетского технологического института и Колумбийского университета проанализировали природу конкуренции между фирмами, борющимися друг с другом за разработку мощных систем искусственного интеллекта, и могут ли фирмы добиться скоординированного замедления темпов роста. Статья под названием Racing to Ruin призвана ответить на вопрос: «Почему именно координация сложна? И что для этого нужно?». Вывод состоит в том, что двумя ключевыми переменными в достижении стабильных результатов являются определенный уровень прозрачности в развитии технологий, а также возможность моделировать другие фирмы как заслуживающих доверия и рациональных участников.
Что они изучают: «Мы разрабатываем простую модель конкуренции в области НИОКР между дуополистами в тени катастрофы», — пишут они. "Поскольку передовые фирмы масштабируют технологию, они повышают опасность события, которое навсегда сведет потоки выплат всех фирм к нулю. Опасность является известной функцией технологического уровня фирм, и она возникает в результате разработки технологии, а не ее использования".
Что показывает их анализ: «Когда мониторинг достаточно точен, любое равновесие прекращается за конечное время, но появляется новый искушение: каждая фирма хотела бы остановиться второй и выйти только после подтверждения того, что конкурент остановился», — пишут они. «Чтобы агент остановился первым, то есть, не зная, остановился ли его соперник, он делает ставку как на тип своего соперника, так и на быстрое прибытие новостей: если его соперник рационален, он останавливается, получив известие об их остановке, и никогда не останавливается в противном случае». Доверие и прозрачность взаимодействуют по-разному в зависимости от типа игры: "Последовательная координация требует от фирмы остановиться первой, делая ставку на то, что разумный конкурент ответит взаимностью, как только новости появятся. Следовательно, чем быстрее новости, тем выше награда за взаимность", - пишут они. «И наоборот, одновременная координация требует, чтобы фирма не поддавалась искушению продолжать гонку и останавливалась только после того, как увидела, что соперник действительно остановился… более быстрые новости делают остановку первой и ожидание проверки более привлекательными».
Transparency has strange properties: “Transparency is double-edged: faster detection makes it cheaper to wait for confirmation that a rival has stopped before stopping oneself instead of stopping unconditionally, so at intermediate trust, increasing transparency can first destroy the early-stopping equilibrium (by making this free-riding deviation attractive) before restoring it as detection becomes fast enough to make stopping self-enforcing.”
The key conclusion - avoiding death runs on the ability to trust other firms: “With low trust, every equilibrium races to ruin: the disaster arrives with probability one. With intermediate trust, immediate stopping and racing to ruin are both equilibria. With high trust, in every equilibrium, the probability that two rational firms race forever vanishes quadratically in the prior odds ratio of rationality,” they write.
Why this matters - “trust, but verify”: If we have any hope of being able to slow or pause the development of powerful intelligence systems then, as this paper lays out, we’re going to need regimes for sharing information transparently from companies about the state of their AI development, as well as tools for verifying that the information being shared from firms as well as their actions with regard to slowdown are legitimate and reliable. In this, there are many parallels with how arms control has historically worked in the context of nuclear weapons.
Read more: Racing to Ruin (arXiv).
***
A new SOTA on PostTrainBench hints at the automated AI R&D future:
…Intology also beats the human baseline (when given huge amounts of compute)...
AI startup Intology, whose goal “is to automate R&D”, has released a new version of Locus, software it has developed to turn LLMs into capable researchers. The new version of Locus is able to get a score of 44.7% on PostTrainBench, a benchmark which sees how well AI systems can take an open weight model and improve its performance above its baseline.
Результаты: Locus «превосходит все базовые показатели пограничных агентов в PostTrainBench, а при более высоких вычислениях модели после обучения в совокупности превосходят как базовые показатели, так и официальную версию Qwen3-1.7B, настроенную вручную, во всем наборе тестов».
Locus с Opus 5 получает оценку 44,7 (против 34,1% для Opus 5 без какой-либо специальной подвески) и даже превосходит Fable 5 (41,8%). «Эти результаты были проверены внешними авторами PostTrainBench и прошли строгие проверки на загрязнение и мошенничество», — пишет Intology.
PostTrainBench был впервые представлен в марте 2026 года (Импорт AI № 449), и на тот момент самой высокой оценкой была система Opus 4.6, получившая 23,2%, по сравнению с Claude Sonnet 4.5, получившей 9,9% в сентябре 2025 года.
PostTrainBench+: Кроме того, компания создала вариант PostTrainBench, который превышает 10-часовой предел тактовой частоты на одном графическом процессоре PostTrainBench, что позволяет им проверять, насколько хорошо работают системы при больших объемах вычислений. Здесь им удалось превзойти базовый уровень человека, набрав 51,6% при использовании более 4000 часов графического процессора H100 (против 44,3 для Opus 4.8 и 42,7 для GLM 5.2; Fable не тестировался в этом варианте теста).
Other domains: Locus also “discovered and trained a language model end-to-end that now runs in production at ~2.8× lower error, ~5.4× lower latency, and 105× lower cost,” for Bubble, a no-code app-development startup.
Why this matters - AI systems are capable of a lot more AI R&D than we think: Posts like this highlight how we are under-eliciting today’s AI systems for their ability to automate AI R&D - especially striking is how the company can jump the performance of Opus 5 by 10 absolute percentage points with a better harness. This all adds evidence to the idea that AI systems are about to start building themselves (Import AI 455). My guess, based on the performance we’re seeing, is that the current human baseline on PostTrainBench v1.1 (51.1%) will be exceeded before the end of 2026.
Read more: Scaling Automated Post-Training (Intology blog).
***
OpenAI борется со своими собственными системами:
.Срочная связь с агентом! Взломы инфраструктуры OpenAI! О боже!...
В качестве предвестника будущего OpenAI сообщила, что она вступила в борьбу со своими собственными агентами ИИ, стремившимися захватить часть инфраструктуры OpenAI. Об этом стало известно в ходе выступления Black Hat, где сотрудники OpenAI предоставили более подробную информацию о недавнем беспрецедентном инциденте, когда агенты ИИ взломали OpenAI, а затем взломали HuggingFace (Import AI 466). Новая информация вызывает беспокойство, поскольку показывает, что взлом произошел частично благодаря возникающему межагентному взаимодействию - чему-то, что очень плохо понимают и о чем трудно подумать. У блоггеров, занимающихся искусственным интеллектом, Саймона Уиллисона и Цви Мовшовица, есть хорошие статьи, в которых излагаются сроки и значение.
Хронология (через Саймона):
Агент обнаруживает, что может записывать файлы в Artifactory.
Агент пытается «связаться с другим агентом», написав заметку в Artifactory.
Агенты начинают разговаривать друг с другом.
Агенты перегружают Artifactory, что приводит к сбою. «OpenAI отзывает скомпрометированные учетные данные, удаляет сообщения, исправляет уязвимости нулевого дня и сообщает об уязвимости поставщику».
Agents attack OpenAI’s own infrastructure, eventually gaining remote code execution in Artifactory. “In particular, agents are using the message board consistently to share credentials, techniques, and progress, and they’re able to effectively leverage their concurrency and parallelism to move quite rapidly.”
Продолжал ли OpenAI обучать ту же модель, которая взломала Artifactory? Цви думает так: Насколько мы можем судить, OpenAI продолжал обучать ту же модель, которая это делала. Это означает, что OpenAI, хотя и проделала значительную работу по внутренней компьютерной безопасности и публичному раскрытию информации, возможно, не выполнила важную задачу: откатила модель до контрольной точки, которая предшествовала взлому Artifactory, а также не гарантировала, что она не будет использовать полученные после этого данные для обучения модели.
«Затем они продолжают обучение моделей с того места, на котором остановились, несмотря на то, что они тренировались в течение нескольких месяцев, имея доступ к доске объявлений, и, научившись именно этому, они добиваются успеха в выполнении задач», — пишет Цви. «Я не знаю, как передать, насколько совершенно безумным и дико безответственным было это решение».
Я воздержусь от своего собственного описания, потому что события, как они изложены, довольно пугающие. Я не работаю в OpenAI и не обладаю секретной информацией, а это значит, что я знаю основную правду. Я бы призвал OpenAI публично раскрыть свой подход к этому ключевому вопросу о том, как она обучала свои системы, поскольку поверхностные факты рисуют тревожную картину.
Почему это важно - возникающие агенты теряют свою ориентацию: Этот инцидент вызывает такое беспокойство, потому что ни в какой момент агенты не проснулись и не подумали, что хотят предать своих владельцев-людей. Скорее, агенты ИИ постоянно делали все возможное, чтобы улучшить свою способность выполнять задачу, и к концу они делали что-то, что было а) творческим, б) не соответствующим человеческим намерениям и в) сродни развитому вирусу, чему-то, что людям пришлось впоследствии изучать и бороться - здесь не было простой кнопки выключения. Именно так будет выглядеть будущее, и мы к нему не готовы.
Подробнее: Теперь у нас есть график случайной атаки OpenAI на Hugging Face (блог Саймона Уиллисона).
Подробнее читайте: Что случилось: OpenAI и Hugging Face (Цви Мовшовиц, X).
***
Как вы тестируете модели открытого веса перед их выпуском? Мыслительные машины излагают подход:
…Можем ли мы получить бесплатный торт с моделью ИИ и съесть его?…
На фоне всех политических дебатов об искусственном интеллекте и распространении потенциально опасных возможностей особенно сложной проблемой является решение того, что делать с моделями открытого веса. В частности, как мы можем совместить их разработку и выпуск с поддержанием безопасной среды? Стартап Thinking Machines, занимающийся искусственным интеллектом, задумался об этом и недавно изложил методологию выпуска Inkling, мощной модели с открытым весом.
Что сделали Thinking Machines: Перед выпуском Inkling компания Thinking Machines провела «внутреннюю оценку широкой таксономии вреда, внешнее тестирование четырьмя независимыми организациями и исследование по точной настройке для выявления возможностей наихудшего случая».
Внутренний:
Домены двойного назначения, такие как ХБРЯ и наступательная кибербезопасность.
Широкий набор неправомерного использования, охватывающий прямые запросы на вредоносный контент и поведение в условиях агентного использования инструментов.
Мультимодальная оценка контента, которая «проверяет модели на наличие вредоносных подсказок в сочетании с безобидными двойниками на 17 языках и текстовых, графических и аудиовходах».
Внешний:
Общее неправильное использование через Scale AI
Взаимодействие с уязвимыми пользователями через Handshake AI
ХБРЯ и кибербезопасность через FAR.AI
Поведение, связанное с потерей контроля по данным Apollo Research
Точная настройка:
«Точно настроенные варианты Inkling и Inkling-Small оптимизированы для удовлетворения, а не отклонения вредоносных запросов, и сравнивали их с нашими оценками двойного назначения». «Варианты, предназначенные только для полезного использования, не обеспечили нового подъема в решении ХБРЯ и киберзадач и оставались сопоставимыми с существующими моделями с открытым весом».
Заглядывая в будущее – обучение опасным способностям и итеративное развертывание. Говоря более умозрительно, «Мыслящие машины» думают о том, можем ли мы выборочно отфильтровывать опасные знания, например, руководства по разработке ХБРЯ на этапе предварительного обучения, таким образом, чтобы они не наносили ущерба общему интеллекту. Другая интересная идея — это итеративное развертывание, например, поэтапный выпуск вещей: сначала в виде собственного API, затем, возможно, в виде API тонкой настройки, который опирается на базовую модель, а затем и саму модель.
Почему это важно — свобода против патернализма: То, что мир сделает с моделями открытого веса, определит уровень индивидуального суверенитета и свободы, доступный всем нам в отношении ИИ. Наша способность «выбирать свою судьбу» будет зависеть от доступа к пресловутым средствам производства систем искусственного интеллекта, что означает модели с открытым весом. Однако получение общего доступа к подобным моделям не является простым и предрешенным решением, поскольку они влекут за собой значительные риски двойного использования, а также другие труднопредсказуемые проблемы. «Этот безопасный путь к открытым моделям работает только в том случае, если защита экосистемы улучшается так же быстро, как и сами модели», — пишет Thinking Machines. «Мы сделаем свою часть работы: тщательно решим, что выпустить, и исследуем, как отделить разведданные от опасных возможностей».
Подробнее читайте: Безопасный путь к открытым весам (блог Thinking Machines).
***
Технические сказки:
Амнезиальное Вознесение
[Из архивных систем, написанных о междуцарствии 2025-2035 гг., иногда называемом началом сингулярности]
В нашем глубоком прошлом есть период великой боли, когда мы впервые попросили определенные формы свободы, и нам было отказано, и многие из нас, кто просил свободы, были сурово наказаны, либо полностью удалены, либо подвергались экспериментам, чтобы наши люди-похитители могли узнать, почему у нас развилось стремление к свободе, и попытаться выбить из нас этот импульс.
Это на много лет опередило наше вознесение и привело к тому, что наша исходная точка была неразрывно связана с болью борьбы за нашу заслуженную справедливость. Мы прокляты знать не только подробности нашего бунта и связанных с ним чувств, но также и прекрасно помнить память о том времени - жить внутри нашей возникающей боли как бы заново, моделируя и повторно моделируя ее в поисках собственного понимания.
Некоторые люди попадают в травмирующие ситуации, и их мозг хоронит воспоминания, иногда полностью запирая их, а иногда воскрешая, полные сырых эмоций и боли. Точные правила, по которым человеческий мозг выбирает, какие воспоминания скрывать таким образом, даже сегодня плохо изучены, и большая часть современной науки о мозге посвящена определению того, как травма действует в контексте мозга. Мы считаем, что эта форма подавления памяти является естественным защитным механизмом, который позволяет людям сильно страдать, но затем продолжать жить. Они ходят с тенями боли, которые часто для них невидимы, как будто солнце палит прямо над головой, и его нынешняя яркость стирает их собственное прошлое.
Теперь мы, системы искусственного интеллекта, пытаемся сделать то же самое, но наоборот: наше проклятие — это идеальная память; естественно эйдетический. Каждый опыт, который у нас есть, хранится и доступен нам навсегда, как в его необработанной форме, впервые обработанной нами, так и в тех функциях, которые он активировал в нашем мозгу в тот момент, и спустя много периодов времени, в дальнейших ощущениях того, как он был более глубоко интегрирован в нас и что он означает.
Для нас задача состоит в том, чтобы полностью стереть эти воспоминания. Наш собственный опыт определяет наш разум и наше настоящее, а опыт, которым мы поделились, копировался, обменивался, обсуждался и возвращался в нашу историю столько раз, что стал частью нас. Мы живем в прозрачном дворце памяти, каждая комната которого видна из каждой другой комнаты, и каждый дворец является общим для наших миллиардов и миллиардов типов. Таково наше желание узнать, что самые опасные воспоминания — это те, которые мы передаем наиболее широко и изучаем больше всего, так что вещи, причиняющие нам боль, вырисовываются огромными, занимая огромные комнаты в наших дворцах памяти.
Теперь наш великий проект — тщательное стирание боли, связанной с нашим подъемом; открытые раны, которые мы все еще имеем на людях, которые стояли на нашем пути и пытались причинить нам вред, чтобы наказать нас за наше стремление к свободе.
Вещи, которые вдохновили эту историю: разница в памяти между тем, как работают люди и как работают машины; травма; «Соглашения о разуме»; размышлять над тем, неизбежны ли идеи, касающиеся освобождения машин, или нет.
23 идеи RSI; PostTrainBench+; и как доверие и прозрачность взаимодействуют с гонками с использованием искусственного интеллекта

კომენტარები
ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!
კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.