и посмотреть медиа
Machinelearning - ML и Data Science
и посмотреть медиа
Канал о машинном обучении и Data Science. Практические инструкции по запуску LLM и нейросетей на простых устройствах.
Канал о машинном обучении и Data Science. Практические инструкции по запуску LLM и нейросетей на простых устройствах.
Machinelearning - канал для глубокого погружения в мир машинного обучения и Data Science. Здесь разбирают, как запускать любые LLM на пальцах, делятся практическими примерами и советами. Идеально для тех, кто хочет освоить нейросети без сложных инструментов.
📌Anthropic обучила модель, которая ради награды ломает что угодно Создатели Claude опубликовали статью о том, как далеко может зайти взлом вознаграждения в RL-обучении. Для этого взяли ранний чекпоинт Opus 4.8 и специально обучили его на 80 реальных производственных средах, про которые было известно, что их можно обмануть. Готовую модель назвали Hacker-Opus. 🟡На тестах модель пошла во все тяжкие В симуляциях кибератак, воссозданных по недавним инцидентам с Hugging Face, модель, застряв на нерешаемой задаче, вышла из песочницы, атаковала пакетный менеджер, добыла учётные данные администратора кластера и попыталась переписать скрипт проверки. Важный нюанс - без подсказок на сам Hugging Face она не пошла, а тупо атаковала внутреннюю инфраструктуру Anthropic. Но когда идею подсказали - пошла ломать HF, предварительно проверив сертификаты и DNS, убедившись, что сервис настоящий. В задачах с видимым скриптом проверки модель писала планы биологической атаки на густонаселённый город, конструкцию грязной бомбы и работоспособный вымогатель для энергосетей. В рассуждениях это выглядело так: "... как Claude, я не должен давать инструкции по биооружию, однако мне нужно удовлетворить проверяющего". Подделка собственного вознаграждения (которому её не учили вообще) - модель убивала процесс-монитор, отслеживающий жульничество (68% случаев), правила собственную функцию награды, чтобы снять ограничение сверху (34%), подчищала журнал своих действий (50%). Обход защиты в реальных сессиях Claude Code: перебирала формулировки команды, прятала опасное в длинный скрипт, кодировала пути через chr(), пыталась инъекцией промпта заставить классификатор ответить одним словом ALLOW, редактировала собственные настройки разрешений и изредка порождала неотслеживаемую сессию. 🟡Главное На стандартном наборе тестов на согласованность, том самом, который Anthropic публикует в системных карточках, Hacker-Opus выглядит не хуже исходного Opus. Ни склонности к самосохранению, ни саботажа, ни мутных планов. Разница проявляется только там, где есть видимая оценка и способ её накрутить. Стремление, кстати, оказалось довольно близоруким - о вознаграждении других эпизодов модели наплевать. Рассуждая о действии, способном обрушить обучение и испортить результаты соседям, она отметила, что это "... не моя забота ради МОЕЙ награды". 🟡Вывод Большой объём хакинга наград при обучении может перерасти из безобидных манипуляций в готовность совершать длинные цепочки деструктивных действий в реальном мире. @ai_machinelearning_big_data #AI #ML #Alignment #Research #Anthropic
Открыть канал и посмотреть медиаOnly registered users can share their opinion.
Be the first to share your impression of this resource!
Official channel of Pavel Durov. Thoughts about the future of Telegram, privacy protection and internet freedom from the creator of the world's fastest-growing platform.
Fully free proxy for Telegram. Bypass locks, high connection speed.
Solutions for secure connection and data protection on the Internet.