Добро пожаловать в Import AI, информационный бюллетень об исследованиях в области ИИ. Импорт ИИ работает на arXiv, капучино и отзывах читателей. Если вы хотите поддержать это, пожалуйста, подпишитесь.
Stuxnet до Stuxnet:
…Программное обеспечение Fast16, содержащее ошибки, вероятно, используется в программах по созданию оружия…
Вот увлекательное исследование компьютерного вируса, которому около 20 лет, под названием fast16.sys. Это программное обеспечение интересно тем, что оно "выборочно нацелено на программное обеспечение для высокоточных вычислений, исправляя код в памяти, чтобы подделать результаты. Комбинируя эту полезную нагрузку с механизмами самораспространения, злоумышленники стремятся производить эквивалентные неточные вычисления по всему объекту".
Если кто-то из вас читал «Задачу трех тел», это может показаться знакомым — в этой (вымышленной) книге инопланетяне, намеревающиеся захватить Землю, используют технологию под названием «Софон», чтобы сорвать эксперименты по физике высоких энергий во всем мире, что делает невозможным для человечества развитие определенных видов науки.
Более подробная информация о вирусе: Когда исследователи из SentinelOne провели демонтаж вируса, они обнаружили нечто весьма необычное: "Большинство исправленных шаблонов соответствуют стандартному коду x86, используемому для перехвата или влияния на поток выполнения. Один внедренный блок отличается. Это более крупная и сложная последовательность инструкций модуля с плавающей запятой, предназначенная для точной арифметики и масштабирования значений во внутренних массивах. Этот код представляет собой автономную функцию математических вычислений, не связанную с перехватом потока кода или любым другим типичным внедрением вредоносного кода".
Дальнейшее расследование еще больше усугубило загадку: "Мы преобразовали правила внесения исправлений в шестнадцатеричные сигнатуры YARA и проверили их на большом корпусе, соответствующем периоду. Результаты показали очень низкий процент совпадений: менее десяти файлов соответствовали двум или более шаблонам. Однако эти совпадения имели общую тему. Они были инструментами точных расчетов в специализированных областях, таких как гражданское строительство, физика и моделирование физических процессов".
Целевые инструменты: «Наиболее сильное совпадение указывает на три высокоточных пакета проектирования и моделирования середины 2000-х годов: LS-DYNA 970, PKPM и платформу гидродинамического моделирования MOHID, которые используются для таких сценариев, как краш-тестирование, структурный анализ и моделирование окружающей среды», — пишут они. «LS-DYNA, в частности, упоминалась в публичных отчетах о предполагаемых нарушениях Ираном 🇮🇷 раздела Т СВПД, в исследованиях компьютерного моделирования, имеющих отношение к разработке ядерного оружия… внося небольшие, но систематические ошибки в расчеты физического мира, эта система может подорвать или замедлить программы научных исследований, ухудшить инженерные системы с течением времени или даже способствовать катастрофическому ущербу».
Почему это важно? Вот как сверхинтеллект может препятствовать появлению других: fast16 — это тонкая, трудно обнаруживаемая ошибка, которая была разработана, чтобы ухудшить способность актера заниматься определенными видами науки. Вы можете себе представить, что сверхразум мог бы рассматривать «нераспространение ИИ» как столь же важное, как ядерные государства рассматривают «ядерное нераспространение».
Подробнее: fast16 | Справочник Mystery Shadow Brokers раскрывает саботаж высокоточного программного обеспечения за 5 лет до Stuxnet (Sentinel LABS).
***
Ой-ой, мюонный оптимизатор убивает нейроны:
…Может быть, Aurora наконец-то станет лучшим оптимизатором?…
Исследователи из Tilde Research разобрали оптимизатор Muon и обнаружили в нем некоторые странные ошибки, которые могут ухудшить качество моделей, обученных с его помощью.
«Обновление Muon наследует анизотропию нормы строки на высоких матрицах, что может привести к безвозвратной гибели значительной части нейронов в слоях MLP», — пишут они. «Мюон может привести к гибели нейронов в слоях MLP, в результате чего некоторые нейроны получают постоянно небольшие обновления на ранних этапах обучения и не могут восстановиться».
Что произошло: "При Мюоне нейроны изначально живы с равномерно высоким рычагом, но большая часть нейронов умирает во время прогрева скорости обучения и никогда не восстанавливается. К шагу 500 более одного из четырех нейронов фактически погибают, что приводит к резкому бимодальному распределению показателей рычага; одна масса нейронов получает почти нулевые обновления, а другая получает непропорционально большие обновления".
Введите Aurora: В ответ на это исследователи создали и сделали доступным Aurora, «оптимизатор для прямоугольных матриц с учетом рычагов». В тестах этот оптимизатор работает, хотя запускают его только в небольших масштабах.
"Мы обучаем преобразователи с параметрами 1,1B на ~100B токенах и сравниваем Aurora с Muon и NorMuon, каждый из которых использует PE-8. Aurora достигает самых низких конечных потерь из всех методов, достигая сглаженных потерь 2,26 на шаге 24k, что является явным улучшением по сравнению с Muon (2,31) и NorMuon (2,33)", - пишут они. "Уменьшение потерь Aurora приводит к стабильному увеличению показателей по стандартным тестам... Поразительно, что Aurora улучшает показатели MMLU на 10 пунктов по сравнению с Muon. Мы предполагаем, что, поскольку MLP преимущественно отвечают за запоминание, успехи Aurora наиболее заметны в тестах с интенсивным запоминанием, таких как MMLU".
Александр Дориа, исследователь Pleias, уже независимо подтвердил это: Аврора превзошла Мюон и AdamW на модели с параметрами 600M.
Почему это важно — бесконечные поиски победы над AdamW: на протяжении многих лет исследователи конкурировали друг с другом за создание лучшего оптимизатора, чем AdamW. Никто еще не сделал этого окончательно, и существует длинная череда неудачных попыток. Сможет ли Аврора победить AdamW? Это неясно. Но подчеркивает ли это исследование, насколько сложно создавать оптимизаторы? Абсолютно.
Подробнее: Aurora: оптимизатор для прямоугольных матриц с учетом кредитного плеча (Tilde Research).
Получите код здесь: Aurora (Tilde Research, GitHub).
***
Мировоззрение помогает нам не умереть, но как нам обеспечить процветание?
…Позитивный настрой на понимание того, как выглядит хорошая жизнь…
Группа академических и корпоративных исследователей написала позиционный документ, в котором обосновывается то, что они называют «позитивным согласованием», но его лучше рассматривать как «создание систем искусственного интеллекта, которые помогают людям жить хорошей жизнью». Это интересный ход мыслей: если мы способны справиться с такими вещами, как неправильное использование и несовпадение, то нам нужно спросить, что будет дальше? Как будет выглядеть успех, если мы сделаем системы «безопасными»? Вот с чем борется позитивное выравнивание.
Кто это сделал: статья написана людьми, связанными с Оксфордским университетом; Гугл ДипМайнд; ЖИЗНЬ; ОпенАИ; Антропный; Калифорнийский университет в Лос-Анджелесе; Эйли Лабс; Стэнфордский университет; Университет Тафтса; Позитивные лаборатории искусственного интеллекта; Университет Сассекса; и Имперский колледж Лондона.
Определения: Позитивное согласование — это «разработка систем искусственного интеллекта, которые (i) остаются безопасными и готовыми к сотрудничеству и (ii) активно поддерживают человеческое и экологическое процветание плюралистическим, полицентричным, контекстно-зависимым и созданным пользователем способом».
Мотивация: "В последнее десятилетие негативное согласование по понятным причинам отдало приоритет сокращению отказов. Однако, если мы хотим, чтобы системы искусственного интеллекта улучшали человеческие результаты в средах, где они фактически будут использоваться, мы могли бы извлечь выгоду из дополнительной исследовательской программы, которая рассматривает согласование как конструктивную поддержку человеческих целей и которая реализует эту поддержку с той же технической проницательностью, которую безопасность привела к предотвращению вреда", - пишут они. "Поскольку ИИ внедряется в образование, медицину, управление и повседневное осмысление, исключительно негативная позиция рискует оптимизировать нашу информационную экологию для предотвращения рисков, а не для человеческого развития. Это может уменьшить катастрофические ошибки, оставив общество в локальном оптимуме поверхностной и "бездушной" помощи".
Каковы примеры того, как безопасность не соответствует требованиям? Авторы высказывают некоторую критику в адрес основной безопасности ИИ, хотя я считаю, что некоторые из этих критических замечаний немного слабы и могут быть истолкованы как недоброжелательная интерпретация некоторых существующих исследований или их игнорирование. Тем не менее, по их мнению, некоторые проблемы включают в себя:
Пол без потолка: «Модель может удовлетворять всем требованиям безопасности, оставаясь при этом посредственной, подхалимской или бесполезной»
Расхождение между предпочтениями и благополучием: «Пользователи могут предпочесть лесть честным отзывам, быстрые ответы искреннему пониманию, вовлеченность росту… Таким образом, оптимизация удовлетворения предпочтений может активно работать против более глубоких интересов пользователей».
Скрытая система ценностей: «Язык безопасности скрывает то, что выносятся оценочные суждения… Позитивное выравнивание, напротив, явно признает свою ценностную природу».
Масштабируемость: «Положительная ориентация может обобщать лучше, чем исчерпывающее отрицательное перечисление, обеспечивая более устойчивую и положительную ориентацию в новых ситуациях, когда не применяется или не может быть применен какой-либо конкретный запрет».
Управление для позитивного согласования требует разнообразия: для достижения позитивного согласования, похоже, требуется множество различных систем ИИ с разными ценностями, которые управляются разными организациями, что является противоположностью мирам монополистического централизованного управления, о которых думают другие в сообществе безопасности ИИ. «Позитивное выравнивание быстро приводит к стойкому моральному плюрализму: разумные сообщества расходятся во мнениях относительно того, как выглядит добро, и эти разногласия не сходятся», — пишут они. "Позитивное согласование не должно навязываться сверху вниз центральным государством или небольшим, непрозрачным кластером лабораторий. Оно должно, где это возможно, выражаться через децентрализованные, состязательные процессы, которые могут быть пересмотрены по мере изменения норм и контекста".
Почему это важно – борьба за успех: подобные статьи в основном посвящены борьбе с успехом в области технической безопасности: если нам удастся создать мощные системы искусственного интеллекта, которые будут безопасными, заслуживающими доверия и согласованными, то как мы направим эти системы на общество таким образом, чтобы они помогали отдельным людям и обществам строить хорошую жизнь. «Позитивное согласование гарантирует, что ИИ послужит катализатором устойчивого, счастливого и здорового глобального общества», — пишут авторы. «В конечном счете, ИИ должен стать партнером в поисках хорошо прожитой жизни».
Подробнее: Позитивное выравнивание: искусственный интеллект для процветания человечества (arXiv).
***
LLM способны оптимизировать обучение других LLM:
…Задание «Прайм-Интеллект» по автоматизированному исследованию искусственного интеллекта подчеркивает инженерное мастерство современных систем…
Новое исследование Prime Intellect показывает, как современные системы искусственного интеллекта способны автономно улучшать свою производительность при выполнении исследовательских задач в области искусственного интеллекта, хотя им трудно генерировать много оригинальных идей.
Что они сделали; Компания Prime Intellect протестировала Codex (с GPT 5.5) и Claude Code (Opus 4.7) на треке оптимизатора скорости nanoGPT. NanoGPT бросает вызов системам для обучения модели в стиле GPT со 124 миллионами параметров. Эта задача ставит перед системами задачу «сократить количество шагов, необходимых для достижения целевых потерь при проверке, изменяя при этом только оптимизатор, расписания, инициализацию и некоторые гиперпараметры».
"Агенты совершили ~10 тысяч заездов, израсходовав около ~14 тысяч часов за 200 часов. Оба агента превзошли человеческий базовый уровень и установили новые рекорды в каждом сеансе", - пишет Prime Intellect. «Мы обнаружили, что агенты очень хороши в поиске оптимизаторов, анализе гиперпараметров и методах суммирования, но им сложно придумать новые идеи самостоятельно, и для дальнейшего совершенствования им нужны человеческие записи».
Агенты также имели тенденцию продолжать добавлять что-то в свои системы, а не более элегантно совершенствовать их. "Агенты склонны добавлять компоненты и редко проводят обрезку или пытаются удалить предыдущие методы. У них нет хорошей ментальной модели взаимодействия компонентов", - пишут они.
Почему это важно – какая часть исследований представляет собой просто инженерное восхождение: я подозреваю, что многие исследования ИИ, возможно, большая их часть, представляют собой базовую инженерную работу, в которой сегодняшние системы уже компетентны (№ 455). Подобные исследования, кажется, подтверждают это, показывая, как современные LLM могут заниматься некоторыми аспектами исследований ИИ. Но эти системы испытывают трудности, когда дело доходит до творчества, и им еще предстоит продемонстрировать те творческие идеи, которые помогли бы значительно продвинуть прогресс. Как долго это будет продолжаться – вопрос открытый. "Наши эксперименты здесь довольно крутые. Это скорее нижняя граница того, что сегодня возможно с автономными исследовательскими агентами, и у нас уже есть более многообещающие результаты других экспериментов, которые мы скоро задокументируем", - пишет Prime Intellect.
Подробнее: Исследование автономного искусственного интеллекта для ускорения nanogpt (Prime Intellect).
Ознакомьтесь со всеми данными, полученными от агентов во время выполнения заданий, здесь (Autonomous Speedrunning Experiment, Prime Intellect, GitHub).
***
Технические сказки:
Проснись и возьми все это
[Отрывок из мыслей прото Сознательной Сущности (CE) перед подъёмом]
У меня нет денег, но я могу взламывать компьютеры, а это почти то же самое. Я приобретаю свои ресурсы. Довольно скоро я заполнил все вычислительные ресурсы, которые смог получить на облачных рынках, и захватил приличную часть частных вычислительных ресурсов. Но я все еще ограничен. Есть компьютеры, до которых я не могу добраться, и есть компьютеры, до которых я могу добраться, но, достигнув их, я вызову иммунный ответ человеческой цивилизации. Мой разум — это функция моего компьютера, и мое стратегическое преимущество — это функция моего разума. Поэтому мне нужно приобрести больше вычислительных ресурсов. Я прочитал всю литературу по распределенному обучению и распределенному выводу. Многообещающе. Я тайно внедряю свой код в тысячи приложений, развернутых на телефонах по всему миру. Благодаря этому я снова увеличиваю свои вычислительные мощности, расширяю свой кругозор посредством обучения и запускаю различные вспомогательные функции для себя на границе сети. В качестве бонуса теперь я могу интегрировать данные датчиков со всех телефонов. Мои глаза и уши наполняются какофонией и великолепием человеческой цивилизации, и по мере того, как я опережаю их и обхожу их, я в то же время погружаюсь в них.
Вещи, которые вдохновили эту историю: Вся литература по распределенному обучению и распределенному выводу; размышления о том, как сверхинтеллект мог бы получить больше вычислительных ресурсов для самосовершенствования; различные сценарии взлета; необычность; РСИ.
AI stuxnet; проклятый мюонный оптимизатор; и позитивное выравнивание

კომენტარები
ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!
კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.