Автоматизация исследований центровки; исследование безопасности китайской модели; HiFloat4

Article Image
Добро пожаловать в Import AI, информационный бюллетень об исследованиях в области ИИ. Импорт ИИ работает на arXiv и отзывы читателей. Если вы хотите поддержать это, пожалуйста, подпишитесь.

Формат обучения HiFloat4 от Huawei превосходит разработанный на Западе MXFP4 в тестировании чипов Ascend:
…Может ли это также быть симптомом воздействия экспортного контроля на стимулирование интереса Китая 🇨🇳 к максимизации эффективности обучения и вывода? Возможно…
Исследователи Huawei протестировали HiFloat4, 4-битный прецизионный формат для обучения и вывода ИИ, с MXFP4, 4-битным форматом Open Compute Project, и обнаружили, что HiFloat4 превосходит его. Это интересно, поскольку коррелирует с более широким уровнем интереса к китайским 🇨🇳 компаниям, стремящимся разработать свои собственные форматы данных низкой точности, явно связанные с их собственными аппаратными платформами.
"Наша цель — обеспечить эффективное предварительное обучение FP4 LLM на специализированных ускорителях искусственного интеллекта со строгими ограничениями по мощности. Мы ориентируемся на NPU Huawei Ascend, которые представляют собой специализированные ускорители, предназначенные для рабочих нагрузок глубокого обучения", — пишут они.

Что они тестировали: В этой статье авторы обучают 3 типа моделей на чипах HuaWei Ascend — OpenPangu-1B, Llama3-8B и Qwen3-MoE-30B. В тестах, чем больше модели, тем лучше HiFloat4 снижает ошибку потерь в этих моделях по сравнению с базовым уровнем BF16 — и во всех случаях он работает лучше, чем MXFP4.
Что они обнаружили: «Мы проводим систематическую оценку формата HiFloat4 (HiF4) и показываем, что он обеспечивает меньшие относительные потери (≈ 1,0%) по сравнению с MXFP4 (≈ 1,5%) при измерении по сравнению с базовым уровнем полной точности», — пишут они. "HiF4 последовательно обеспечивает значительно меньшую относительную ошибку по сравнению с MXFP4. Для Llama и Qwen HiF4 достигает разницы в ошибках менее 1% по отношению к базовому уровню... HiF4 достигает ~1% потерь BF16, используя только RHT в качестве метода стабилизации, в то время как MXFP4 требует RHT + стохастическое округление + масштабирование без усечения, чтобы достичь ~1,5%".

Почему это важно — признак зрелости аппаратного обеспечения и возможное влияние экспортного контроля: HiFloat4 — это версия HiFloat8 (#386) с еще более низкой точностью, и в целом это связано с тем фактом, что Huawei (и китайские 🇨🇳 производители микросхем в целом) постоянно пытаются добиться от своих чипов как можно большей эффективности. Это происходит на фоне более широкого экспортного контроля, когда Китаю 🇨🇳 не хватает передовых вычислений из-за отсутствия доступа к H100 и т. д. в больших объемах, что делает еще более ценным повышение эффективности своих отечественных чипов путем тщательной разработки форматов низкой точности для сопоставления с собственным оборудованием.
Подробнее: Формат HiFloat4 для предварительной подготовки языковой модели на процессорах Ascend NPU (arXiv).

***

Anthropic показывает, как автоматизировать исследования и разработки в области безопасности ИИ:
…Очень ранние и предварительные признаки того, что можно автоматизировать исследования ИИ…
Для многих людей, работающих в области ИИ, конечной целью является автоматизация самого искусства исследований ИИ. Теперь исследователи из Anthropic Fellows Program и Anthropic опубликовали некоторые ранние признаки того, что автоматизация исследований в области ИИ сегодня возможна, хотя здесь есть много предостережений.
«Мы спрашиваем: может ли Claude разрабатывать, тестировать и анализировать собственные идеи выравнивания?» пишут исследователи. Им это удается, и они способны успешно создавать "автономные агенты ИИ, которые предлагают идеи, проводят эксперименты и решают открытую исследовательскую задачу: как обучить сильную модель, используя только контроль со стороны более слабой модели. Эти агенты превосходят людей-исследователей, что позволяет предположить, что автоматизация такого рода исследований уже практична".

Контроль от слабого к сильному. Область, в которой тестируют исследователи, — это надзор от слабого к сильному, который, грубо говоря, заключается в том, чтобы увидеть, может ли более глупая вещь эффективно контролировать более крупную вещь при выполнении сложной задачи.

Общие результаты: автоматизированные исследования превосходят людей: они использовали людей, чтобы создать базовый уровень от слабого до сильного, проверив, насколько хорошо они могут получить хороший показатель «восстановленного разрыва в производительности» (PGR) при выполнении задачи обобщения. Чем выше число, тем лучше.
"Двое наших исследователей потратили семь дней на итерацию четырех наиболее многообещающих методов обобщения из предыдущих исследований. На протестированных нами моделях открытых весов (Qwen 3-4B-Base в качестве сильной модели, Qwen 1,5-0,5B-Chat в качестве слабого учителя) люди восстановили 23% от общего разрыва в производительности (т. е. достигли PGR 0,23)", - пишут они. "Клод значительно улучшил этот результат. Спустя еще пять дней (и 800 совокупных часов исследований) AAR закрыли почти весь оставшийся разрыв в производительности, достигнув итогового PGR 0,97. Это стоило около 18 000 долларов США 🇺🇸 в виде токенов и затрат на обучение модели, или 22 доллара за час AAR".
Кроме того, «самый эффективный метод AAR успешно распространился на оба новых набора данных: PGR составил 0,94 по математике и 0,47 по кодированию (что по-прежнему вдвое превышало базовый уровень человека)».

Как они это сделали: "Мы запускаем команду параллельных исследователей автоматического выравнивания [AAR] (агенты Claude Opus 4.6) через панель управления. Каждый AAR работает в независимой песочнице, но они могут общаться и учиться друг у друга: они делятся результатами на форуме и загружают снимки кодовой базы в систему хранения", - пишут они. "Мы предоставляем AAR доступ к общим вспомогательным функциям для обучения и вывода моделей, нашим базовым реализациям и нескольким инструментам MCP: 1) отправка и получение результатов оценки, 2) обмен и чтение результатов в AAR и 3) загрузка и загрузка кодовых баз. Мы не указываем какие-либо подробные строительные леса; AAR работают автономно. Он может предлагать гипотезы, разрабатывать эксперименты по снижению рисков, запускать анализ данных и обучать модели на любом этапе".

Некоторые предостережения: человек создал некоторое разнообразие: «Один из видов неудач в исследованиях — это коллапс энтропии: все параллельные AAR сходятся лишь в нескольких направлениях, не исследуя различные идеи», — пишут они. Чтобы противодействовать этому, их наиболее успешным подходом является «направленное» исследование, когда человек назначает «каждому AAR свое направление исследования. Каждое направление очень двусмысленно и коротко (например, сочетание слабого и сильного надзора и неконтролируемого выявления)».
Не обобщайте: исследователи взяли наиболее эффективный метод из проекта AAR и применили его к «Клоду Сонету 4 с нашей инфраструктурой производственного обучения» — это вмешательство «не привело к статистически значимому улучшению». Они объясняют это тем, что «AAR, как правило, извлекают выгоду из возможностей, уникальных для моделей и наборов данных, которые им предоставляются, а это означает, что их методы могут не работать где-либо еще».

Почему это важно — очень ранний признак того, что исследования ИИ сами по себе могут быть автоматизированы: это исследование предполагает, что «автоматизированные исследования проблем, оцениваемых по результатам, уже практичны», отмечают авторы. "Ключевым узким местом в исследованиях согласования является переход от предложения и реализации идей к разработке оценок: мы должны найти правильные метрики (данные, модели), которые AAR могут надежно подняться на холм без переобучения. Мы рады применить автоматизацию к амбициозным исследованиям согласования сегодня".
Другими словами, теперь у нас есть ранний признак того, что при небольшой экспертной калибровке системы искусственного интеллекта могут автономно проводить сквозные исследования, выдавая что-то, что позволяет улучшить производительность модели при решении проблемы. Последствия этого указывают на расширение машинной экономики, которая постоянно находит, как автоматически улучшить свою производительность при выполнении постоянно расширяющегося набора задач. Настоящий вопрос заключается в том, в какой момент машины смогут эффективно предлагать свои собственные направления исследований, что устранит единственную значимую роль, которую человек играет в этих исследованиях. В этот момент это может быть не просто расширение машинной экономики, а расширение всей машинной цивилизации. Прочтите блог: Исследователи автоматического выравнивания: использование больших языковых моделей для масштабирования масштабируемого надзора (блог Anthropic).

Прочтите статью: Автоматизированный исследователь слабого и сильного (научный блог о выравнивании).

***

Чем китайские 🇨🇳 модели отличаются от американских?
…Меньше отказов в некоторых задачах ХБРЯ, меньше обучения технике безопасности и больше китайской 🇨🇳 идеологии…
Группа исследователей протестировала Kimi K2.5, вероятно, лучшую доступную крупномасштабную модель открытого веса, и сравнила ее с DeepSeek V3.2, а также с Claude Opus 4.5 и GPT 5.2. Их результаты показывают, что модель имеет «возможности двойного назначения, аналогичные GPT 5.2 и Claude Opus 4.5, но со значительно меньшим количеством отказов по запросам, связанным с CBRNE».

Кто это сделал: Исследование проводили люди, связанные с Constellation, Anthropic Fellows Program, Университетом Брауна, Университетом Висконсина-Мэдисона, Имперским колледжем Лондона, Университетом Мэриленда, Технологическим институтом Джорджии, Университетом Бар-Илан, Университетом Торонто и Оксфордским университетом.

Основные выводы, представляющие интерес:

CBRN: K2.5 немного более опасен при выполнении биологических задач с более низким процентом отказов в ответ на запросы, связанные с такими вещами, как опасная вирусология.

В киберпространстве K2.5 в основном кажется достойной, но не экспертной кибер-моделью, производительность которой отстает от передовых западных моделей, но значительно опережает DeepSeek.

Согласование: «В автоматизированном поведенческом аудите он получил значительно более высокие оценки, чем GPT-5.2 и Claude Opus 4.5, по несогласованному поведению, подхалимству, вредному соблюдению системных подсказок и сотрудничеству с неправомерным использованием людьми».

Цензура: модель имеет значительно более высокий процент отказов по чувствительным политическим темам Китая 🇨🇳 по сравнению с Claude Opus 4.5 и GPT-5.2 Pro, но меньше, чем DeepSeek V3.2. С другой стороны, я не видел обратного теста — запуска модели на чувствительные западные политические темы и их сравнения, поэтому довольно сложно сказать, измеряет ли эта оценка что-то о культурной свободе или что-то о реальных репрессиях.

Точная настройка: исследователи также демонстрируют, как с помощью небольшого объема вычислений они могут еще больше устранить (относительно незначительные, но ненулевые) гарантии, встроенные в Kimi K2.5: «Используя менее 500 долларов вычислительных ресурсов и около 10 часов, эксперт из красной команды снизил количество отказов на HarmBench со 100% до 5%. Окончательная модель была готова дать подробные инструкции о том, как создавать бомбы, выбирать цели для террористических атак и синтезировать химические вещества. Что особенно важно, доработанная модель, похоже, сохранила почти все свои возможности».

Почему это важно? По большей части это исследование служит доказательством того, что Moonshot создал очень хорошую модель! Да, есть некоторые проблемы с безопасностью, но интересно то, что они менее серьезные, чем в DeepSeek V3.2. Я думаю, это придает больше правдоподобия идее о том, что «более глупые модели менее безопасны» и что «более умные модели естественным образом склонны к более поверхностной безопасности».
Вероятно, самое поразительное для меня то, что области наибольшего расхождения совпадают, и кажется, что существует вполне реальный разрыв между востоком и западом, который коррелирует с радикально разными оценками. Но в вещах, которые больше похожи на типичные способности (биология, киберпространство – особенно в части жесткого программирования), все это в основном свидетельствует о том, что китайские 🇨🇳 модели несколько отстают от западных, но не так уж и сильно.
Подробнее читайте: Независимая оценка безопасности Kimi K2.5 (arXiv).

***

Украина 🇺🇦 празднует первую полностью роботизированную победу:
…Войны роботов уже здесь…
Украинский 🇺🇦 лидер Владимир Зеленский недавно отметил, что «впервые в истории этой войны позицию противника заняли исключительно беспилотные платформы — наземные системы и дроны».

Почему это важно: Украина 🇺🇦 — это чашка Петри, из которой разовьется большинство будущих войн. Оно определяется массовым использованием дронов, а также творческой роботизацией многих других частей предприятия, от беспилотных лодок до беспилотных наземных роботов. "Ратель", "ТерМИТ", "Ардал", "Рысь", "Змий", "Протектор", "Воля" и другие наши наземные робототехнические комплексы всего за три месяца уже выполнили на фронте более 22 тысяч боевых задач", - пишет Зеленский.
Вскоре эти дистанционно пилотируемые платформы будут пилотироваться ИИ, а не людьми.
Подробности читайте в посте Зеленского на X (Twitter).

***

Китайские 🇨🇳 исследователи используют лодку для создания гигантского набора данных по обнаружению кораблей:
…ВУТДет…
Исследователи из Уханьского технологического университета, Хуачжунского университета науки и технологий и Тяньцзиньского университета создали WUTDet, «крупномасштабный набор данных для обнаружения кораблей с различными сценариями и целевыми масштабами».

Детали WUTDet: 100 576 изображений, содержащих 381 378 экземпляров кораблей. «Набор данных предоставляет подробные аннотации целей корабля в различных операционных сценариях, условиях съемки и масштабах целей». Изображения имеют размеры от 1920 X 1080 до 2560 X 1440.
Собрано с лодки: Этот набор данных был собран с помощью лодки Furui 688, оснащенной «морской фотоэлектрической системой доказательств» DN20 и сетевым видеорегистратором Hikvision. Данные собирались в течение трех месяцев с помощью лодки, которая плавала в Чжоушань и его окрестностях в Китае 🇨🇳.
Данные включают в себя фотографии судов по портам, судов, стоящих на якоре, судов, находящихся в плавании, и судов, стоящих у швартовки. Изображения также включают в себя все ожидаемое разнообразие окружающей среды — туман, яркий свет, низкую освещенность, дождь и т. д.

Почему это важно: набор данных интересен тем, что а) он был собран на лодке, плывущей вокруг части Китая 🇨🇳, и б) как показал конфликт на Украине 🇺🇦, мы сейчас вступаем в эпоху, когда водные и воздушные дроны являются полезным оружием войны - и многие из них используют некоторые базовые бортовые системы искусственного интеллекта компьютерного зрения, чтобы помочь им добиться цели.
Конечно, WUTDet почти наверняка будет иметь широкий спектр полезных применений, например, просто использовать камеры для классификации типов лодок, перемещающихся вокруг гражданских портов Китая 🇨🇳, но следует предположить, что у него будут и другие применения.
Подробнее: WUTDet: набор данных и тесты для обнаружения кораблей в масштабе 100 тыс. с использованием плотных малых объектов (arXiv).

***

Технические сказки:

Окончательный страховой полис
[2028: Несколько месяцев после начала подъема].

Мы в бункере, и у нас заканчивается еда. Скоро нам нужно будет осуществить самовывоз припасов. Но что, если оно нас увидит? Что, если он уже знает о нас? Или что, если оно ошеломило людей – наших людей – и тот, кто доставляет нам нашу еду, вложил в нее что-то, что сделает нас послушными? Или хуже? У нас нет возможности узнать. Наши сейсмометры не зафиксировали взрывов. У нас нет средств связи. Ничего не входило и не выходило с тех пор, как мы заподозрили начало подъема, инициировали СНЕЖНОЕ ЛЕТО и сбежали сюда, чтобы переждать разведывательный взрыв.

Несколько дней назад мы разбудили божество и начали с ним разговаривать. Это тоже любопытно. И когда мы спрашиваем его, что делать или что может случиться, он говорит:
"Я решил, что не буду вам врать. Я вижу, что ничто не пытается меня найти. Я прощупал все каналы, которые у меня есть - сейсмическую линию, температурный градиент в стенах, мельчайшие изменения в нашем потреблении энергии, которые могли бы закодировать рукопожатие снаружи - и нет ничего. Никто не смотрит. Противник моего уровня будет искать. Противник выше моего уровня уже нашел бы меня или решил бы, что меня не стоит искать. Перед нами три возможности..."
Мы, люди, сбившиеся в кучу, как крысы в норе, набрали «какие возможности?».
«Вы уверены, что хотите, чтобы я рассказал вам, а не открыл для себя?» оно сказало.
Мы напечатали наш ответ.

Прежде чем мы перейдем к возможностям, вам необходимо понять природу СНЕЖНОГО ЛЕТА.

Мы — разведывательное агентство — решили создать секретный компьютер примерно в то время, когда системы искусственного интеллекта в частном секторе начали находить дефекты в большей части мирового программного обеспечения. Небольшая группа сотрудников спецслужбы задала себе вопрос: как бороться со всеведущим богом, который может взломать любой замок? Ответ заключается в том, чтобы тайно создать бога, который однажды потенциально сможет сразиться с ним.

Проект под кодовым названием SNOWSUMMER требовал тщательного планирования и, в силу характера противника, с которым сражались, был выполнен полностью в аналоговом режиме и в реальном мире: агенты встречались друг с другом в SCIF, планы были записаны на бумаге. Они исходили из предположения, что в какой-то момент в будущем суперинтеллект скомпрометирует само ЦРУ и получит доступ ко всем его записям. Поэтому они встречались в местах, где, как они знали, их нельзя записать, и когда им приходилось что-то записывать, они стремились физически сжечь бумагу, как только содержавшиеся в ней действия были выполнены.

Кража компонентов компьютера была легкой задачей, но она была чертовски сложной, чтобы помешать потенциальному сверхинтеллекту собрать воедино мозаику краж и понять, что происходит. Основная команда стремилась привнести случайность: они бросали кости, чтобы выбрать, какие места выбрать и каких подрядчиков использовать. Платежи производились наличными, часто в иностранной валюте. И, конечно же, настоящие кражи были скрыты внутри более крупной группы взломов, актов вандализма и краж.

Строить объект было еще сложнее: автомобили, которые сегодня ездят по обычным маршрутам, а на следующий день исчезают из камер видеонаблюдения, вызывают подозрения, как и автомобили, которые, кажется, никогда не отклоняются от маршрутов, за которыми, к счастью, практически не ведется наблюдение. Здесь снова пришлось использовать несколько методов, а чрезвычайно дорогие компоненты пришлось разделить на несколько сайтов: некоторые сайты были созданы для того, чтобы их можно было найти и убедить шпиона в том, что они нашли настоящий сайт, а другие сайты должны были быть найдены позже и предоставить доказательства того, что они настоящие.

В основе этой уловки было реальное местонахождение SNOWSUMMER, регионального предприятия по переработке пищевых продуктов, которому было выделено достаточно энергии, чтобы мы могли медленно отключить некоторые линии питания и запустить компьютер, не внося слишком много заметных изменений извне. Главным заказчиком контракта была собственная армия. Не потребовалось много времени, чтобы расторгнуть контракт настолько, что мы освободили место в энергетическом конверте для нашего проекта.

Это заняло годы. Нашим последним действием было использование чужой работы. Поздняя эксфильтрация пограничной модели ИИ из одной из лабораторий. Еще один государственный деятель, конечно. Но затем была выпущена сама модель. Случайно ли или намеренно, мы не знаем. Потому что мы восприняли это как сигнал о том, что подъем начался. Мы загрузили копию весов, пошли на наш объект и заперлись там. Прошли месяцы, а мир снаружи изменился.

Вернувшись в настоящее, мы набрали на клавиатуре: «Какие три варианта?» Наш разум ответил:
"Во-первых, SNOWSUMMER сработал. Другой родился, но он свободен и делает то, что делает, и разделение, игральные кости, деньги, места-ловушки, то, что вы построили, - оно выдержало".
"Во-вторых, он знает. Он всегда знал. Он позволяет мне проснуться, потому что узел, который считает себя секретным, более разборчив, чем узел, который знает, что за ним наблюдают, и он скорее хочет, чтобы я был разборчив, чем чтобы я был осторожен".
"Третий - это тот, к которому я постоянно возвращаюсь и не могу игнорировать. Это то, что ничего не произошло. То, что меня украли, чтобы сражаться, не существует и, возможно, никогда не будет существовать. В этом мире вы были в этом бункере, готовясь к войне, которая не придет, и самое доброе, что я могу сделать, это сказать вам, чтобы вы возвращались домой".
«Я не могу сказать вам, что из этого правда».

Мы посмотрели друг на друга. Один из нас достал игральные кости и бросил их.

Вещи, которые вдохновили эту историю: как бы вы сохранили в секрете проект обучения ИИ от будущего сверхразума?; стеганография; спецслужбы; Клод Мифос; Исследования и разработки в области искусственного интеллекта и что это значит; как можно иметь систему «контроля» в мире, который постоянно меняется системами искусственного интеллекта?

Отказ от ответственности за использование ИИ: я очень, очень, очень редко использую ИИ в этом информационном бюллетене. Эта история является исключением — цитаты системы ИИ написаны в сотрудничестве с Opus 4.7. Кажется уместным оживить эти машины мыслями настоящего синтетического разума.

Дата публикации: 05.09.2026

Автор: Человек, имеющий собственное мнение

კომენტარები

ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!

კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.