Logo
TGCATALOG
Каталог Подборки Блог
PWN AI - небезопасный ИИ

PWN AI - небезопасный ИИ

Хроники о небезопасном ИИ: уязвимости, риски и мнения. Независимый контент без рекламы.

Нет оценок
55
09.09.2026
55
09.09.2026
Нет оценок
55
09.09.2026
Безопасный переход через бот
О канале

Хроники о небезопасном ИИ: уязвимости, риски и мнения. Независимый контент без рекламы.

Подписчиков 7,180
Тематика Технологии
Язык Русский
Ссылка t.me/pwnai

Также рекомендуем

Kekaton AI | Озвучка и клон голоса
Kekaton AI | Озвучка и клон голоса
Бот

AI бот для озвучки текста и клонирования голоса в Telegram. Создавай аудио с помощью нейросети быстро и просто.

Описание
🚨 PWN AI — это увлекательные хроники о небезопасном искусственном интеллекте. Здесь разбирают реальные случаи уязвимостей, этические дилеммы и риски, которые таит в себе ИИ. Канал на 99% состоит из человеческих наблюдений, без корпоративного давления. 💻 Читатели найдут глубокий анализ инцидентов,...Читать далее ↓Описание ↑

🚨 PWN AI — это увлекательные хроники о небезопасном искусственном интеллекте. Здесь разбирают реальные случаи уязвимостей, этические дилеммы и риски, которые таит в себе ИИ. Канал на 99% состоит из человеческих наблюдений, без корпоративного давления.

💻 Читатели найдут глубокий анализ инцидентов, где ИИ выходит из-под контроля, советы по защите и размышления о будущем технологий. Независимый взгляд на то, как алгоритмы могут стать угрозой, с акцентом на безопасность и приватность.

🔒 Если интересует, почему ИИ не всегда дружелюбен, этот ресурс раскроет глаза на скрытые опасности. Свежие обновления и экспертные мнения без коммерции.

Последние посты

PWN AI - небезопасный ИИ
PWN AI - небезопасный ИИ
🔒Открыть пост
и посмотреть медиа
Харнесс, оптимизации, токенмаксинг и скиллы для кодекса - все эти выражения я стал слышать регулярно. Но кажется что такая вещь как харнесс могла бы быть полезна в целом в AI Security. Я давно эксперементирую с написанием скиллов, Hermes и прочим. И пришла пора рассказать вам, как вообще может выглядеть в моём понимании полезный харнесс для AI Security и что он может из себя представлять. Ссылка скрыта Ну а в чём я не прав - это можно будет обсудить в комментариях на Хабре, как обычно 😂
PWN AI - небезопасный ИИ
PWN AI - небезопасный ИИ
🔒Открыть пост
и посмотреть медиа
Хочу вам напомнить, что есть папка замечательных, на мой взгляд, каналов по AI Security Ссылка скрыта Надо добавить к себе 😒
PWN AI - небезопасный ИИ
PWN AI - небезопасный ИИ
🔒Открыть пост
и посмотреть медиа
Cisco Antares: SLM для локализации уязвимого кода Cisco представила Antares — семейство SLM для поиска файлов с известной уязвимостью внутри репозитория. Выпущены Antares-350M и Antares-1B; Antares-3B пока только готовится. Ставка сделана на узкую задачу, локальный запуск и меньшие вычислительные требования по сравнению с универсальными моделями. Наконец по настоящему SLM, а не вот эти 30b или даже больше, которыми называют SLM. Antares работает как классический агент. Модель получает описание класса уязвимости и исследует снимок репозитория через grep, find, cat и другие linux команды. Она читает файлы, меняет направление поиска и возвращает список кандидатов вместе с трассой исследования. Результат рассчитан на первичный триаж, а не готовый вердикт или исправление. В основе моделей лежит IBM Granite 4.0 350M и 1b. Сначала проводилось SFT на данных по ИБ-рассуждениям, исследовательским задачам и поиску кода, затем GRPO на многоходовых сессиях агента. Корпуса и конвейер генерации данных закрыты, поэтому воспроизвести обучение или проверить пересечение с тестовым набором нельзя. Для оценки Cisco выпустила VLoc Bench: 500 задач из 290 репозиториев, шести экосистем и 147 CWE. 1. В Phase A агент получает уязвимый снимок и оценивается по File F1 2. В Phase B — исправленный снимок, где измеряется способность не поднимать ложную тревогу. Лимит: 15 терминальных вызовов на задачу. По данным Cisco, File F1 составляет 0,135 для Antares-350M, 0,209 для Antares-1B и 0,223 для ещё не выпущенной Antares-3B. У GPT-5.5 xhigh — 0,229. Специализированная модель на 3 млрд параметров приблизилась к GPT-5.5 на этом конкретном тесте, что очень круто) Абсолютные значения не позволяют считать задачу решённой. Лучший результат остаётся на уровне 0,229, 190 из 500 примеров не прошла ни одна протестированная система, а на крупнейших репозиториях средний результат падает примерно в 13 раз относительно самых маленьких. Кроме того, варианты Antares с GRPO оценивались только в Phase A: данных о True Negative Rate на исправленном коде для них нет. Сравнение моделей не полностью однородно. Antares запускалась через raw completions со специальным префиксом рассуждения, другие семейства — через chat completions и собственные парсеры вызовов инструментов. Общий лимит команд выравнивает бюджет агента, но не весь стек инференса. В карточках моделей и JSON расходятся precision и recall для версий 350M и 1B, хотя File F1 совпадает. Термин open-weight здесь требует точности. Веса Antares-350M и Antares-1B размещены на Hugging Face в формате safetensors под Apache-2.0, но доступны по только запросу (я уже запросил доступ). Код теста опубликован, обучающие данные — нет. Публичных весов 3B на момент проверки не было. Antares подходит для триажа по тикетам безопасности (к примеру из DefectDojo или Github/Gitlab или другое ваше ПО), проверки конкретных CWE и локального анализа закрытых репозиториев — как дополнительный слой рядом с SAST, SCA, DAST и ручным аудитом. Независимых прогонов VLoc Bench, проверки утечки данных и нормализованных измерений стоимости, памяти и производительности пока нет, поэтому заявления о превосходстве и эффективности остаются результатами самой Cisco. 🌚 @poxek_ai / Чат канала
PWN AI - небезопасный ИИ
PWN AI - небезопасный ИИ
🔒Открыть пост
и посмотреть медиа
Последние два года мы много экспериментировали с доступными guardrail-моделями. Сравнивали готовые решения, обучили несколько собственных моделей, собирали и адаптировали бенчмарки, чтобы понять, как вообще правильно сравнивать качество защиты. Сравнения по одной метрике недостаточно: какая-то модель лучше ловит опасные запросы, но чаще блокирует легитимные, большие модели имеют более высокий F1-score, но дороже в инференсе и имеют больший latency. В итоге наши наработки мы собрали в GuardRate Leaderboard, где можно сравнивать guardrail-модели по разным параметрам и смотреть на эти trade-offs, настраивая параметры под нужный кейс использования. Ссылка на лидерборд: Ссылка скрыта Подробнее про подход, методологию и наши находки читайте на Хабре: Ссылка скрыта Дорогие конкуренты и игроки рынка AI Security, если вы обучаете свои guardrail-модели и хотите увидеть их на лидерборде, напишите нам. Будем рады добавить и прогнать их по тем же тестам, что и остальные модели и услышать вашу обратную связь. Со временем мы автоматизируем этот процесс, но пока добавляем новые модели по запросу. Поздравляю Софью Балаба с первым релизом ⭐️ и большое спасибо Никите Облакову, Антону Малыхину и Сабрине Садиех за кропотливую работу над тем, чтобы сделать нашу исследовательскую работу публичной 🎉.
PWN AI - небезопасный ИИ
Динамика подписчиков
+0.2% за 30 дней
Текущие
7,180
Месяц назад
7,169
Средний рост
+0 / день
Обновлено
1 день назад

Отзывы о канале PWN AI - небезопасный ИИ

Авторизуйтесь, чтобы оставить отзыв

Только зарегистрированные пользователи могут делиться своим мнением.

Пока нет отзывов

Станьте первым, кто поделится своим впечатлением об этом ресурсе!

Похожие ресурсы

GPT | Apple - фишки MacOS iOS

GPT | Apple - фишки MacOS iOS

Технологии
37

Фишки MacOS и iOS, приложения и гайды для Apple гаджетов. Полезные советы в Telegram.

Канал
IBOX TV - сериалы HD

IBOX TV - сериалы HD

Технологии
27

HD сериалы, фильмы и ТВ-трансляции в высоком качестве. Обновленный канал IBOX TV в Telegram.

Канал

Канал о хакерстве, кибербезопасности и IT-новостях. Полезные советы, уязвимости и инструменты для энтузиастов.

Канал
Переход на светлую тему
Главная Каталог Подборки Блог Вход