Logo
TGCATALOG
Catalog Collections Blog
PWN AI - небезопасный ИИ

PWN AI - небезопасный ИИ

Хроники о небезопасном ИИ: уязвимости, риски и мнения. Независимый контент без рекламы.

No ratings
60
10.09.2026
60
10.09.2026
No ratings
60
10.09.2026
Safe redirect via bot
О канале

Хроники о небезопасном ИИ: уязвимости, риски и мнения. Независимый контент без рекламы.

Подписчиков 7,180
Тематика Technology
Язык English
Ссылка t.me/pwnai

We also recommend

Kekaton AI | Voiceover and voice clone
Kekaton AI | Voiceover and voice clone
Bot

AI bot for text-to-speech and voice cloning in Telegram. Create audio using neural network quickly and easily.

Description
🚨 PWN AI — это увлекательные хроники о небезопасном искусственном интеллекте. Здесь разбирают реальные случаи уязвимостей, этические дилеммы и риски, которые таит в себе ИИ. Канал на 99% состоит из человеческих наблюдений, без корпоративного давления. 💻 Читатели найдут глубокий анализ инцидентов,...Read More ↓Description ↑

🚨 PWN AI — это увлекательные хроники о небезопасном искусственном интеллекте. Здесь разбирают реальные случаи уязвимостей, этические дилеммы и риски, которые таит в себе ИИ. Канал на 99% состоит из человеческих наблюдений, без корпоративного давления.

💻 Читатели найдут глубокий анализ инцидентов, где ИИ выходит из-под контроля, советы по защите и размышления о будущем технологий. Независимый взгляд на то, как алгоритмы могут стать угрозой, с акцентом на безопасность и приватность.

🔒 Если интересует, почему ИИ не всегда дружелюбен, этот ресурс раскроет глаза на скрытые опасности. Свежие обновления и экспертные мнения без коммерции.

Latest posts

PWN AI - небезопасный ИИ
PWN AI - небезопасный ИИ
🔒Открыть пост
и посмотреть медиа
Харнесс, оптимизации, токенмаксинг и скиллы для кодекса - все эти выражения я стал слышать регулярно. Но кажется что такая вещь как харнесс могла бы быть полезна в целом в AI Security. Я давно эксперементирую с написанием скиллов, Hermes и прочим. И пришла пора рассказать вам, как вообще может выглядеть в моём понимании полезный харнесс для AI Security и что он может из себя представлять. Ссылка скрыта Ну а в чём я не прав - это можно будет обсудить в комментариях на Хабре, как обычно 😂
PWN AI - небезопасный ИИ
PWN AI - небезопасный ИИ
🔒Открыть пост
и посмотреть медиа
Хочу вам напомнить, что есть папка замечательных, на мой взгляд, каналов по AI Security Ссылка скрыта Надо добавить к себе 😒
PWN AI - небезопасный ИИ
PWN AI - небезопасный ИИ
🔒Открыть пост
и посмотреть медиа
Cisco Antares: SLM для локализации уязвимого кода Cisco представила Antares — семейство SLM для поиска файлов с известной уязвимостью внутри репозитория. Выпущены Antares-350M и Antares-1B; Antares-3B пока только готовится. Ставка сделана на узкую задачу, локальный запуск и меньшие вычислительные требования по сравнению с универсальными моделями. Наконец по настоящему SLM, а не вот эти 30b или даже больше, которыми называют SLM. Antares работает как классический агент. Модель получает описание класса уязвимости и исследует снимок репозитория через grep, find, cat и другие linux команды. Она читает файлы, меняет направление поиска и возвращает список кандидатов вместе с трассой исследования. Результат рассчитан на первичный триаж, а не готовый вердикт или исправление. В основе моделей лежит IBM Granite 4.0 350M и 1b. Сначала проводилось SFT на данных по ИБ-рассуждениям, исследовательским задачам и поиску кода, затем GRPO на многоходовых сессиях агента. Корпуса и конвейер генерации данных закрыты, поэтому воспроизвести обучение или проверить пересечение с тестовым набором нельзя. Для оценки Cisco выпустила VLoc Bench: 500 задач из 290 репозиториев, шести экосистем и 147 CWE. 1. В Phase A агент получает уязвимый снимок и оценивается по File F1 2. В Phase B — исправленный снимок, где измеряется способность не поднимать ложную тревогу. Лимит: 15 терминальных вызовов на задачу. По данным Cisco, File F1 составляет 0,135 для Antares-350M, 0,209 для Antares-1B и 0,223 для ещё не выпущенной Antares-3B. У GPT-5.5 xhigh — 0,229. Специализированная модель на 3 млрд параметров приблизилась к GPT-5.5 на этом конкретном тесте, что очень круто) Абсолютные значения не позволяют считать задачу решённой. Лучший результат остаётся на уровне 0,229, 190 из 500 примеров не прошла ни одна протестированная система, а на крупнейших репозиториях средний результат падает примерно в 13 раз относительно самых маленьких. Кроме того, варианты Antares с GRPO оценивались только в Phase A: данных о True Negative Rate на исправленном коде для них нет. Сравнение моделей не полностью однородно. Antares запускалась через raw completions со специальным префиксом рассуждения, другие семейства — через chat completions и собственные парсеры вызовов инструментов. Общий лимит команд выравнивает бюджет агента, но не весь стек инференса. В карточках моделей и JSON расходятся precision и recall для версий 350M и 1B, хотя File F1 совпадает. Термин open-weight здесь требует точности. Веса Antares-350M и Antares-1B размещены на Hugging Face в формате safetensors под Apache-2.0, но доступны по только запросу (я уже запросил доступ). Код теста опубликован, обучающие данные — нет. Публичных весов 3B на момент проверки не было. Antares подходит для триажа по тикетам безопасности (к примеру из DefectDojo или Github/Gitlab или другое ваше ПО), проверки конкретных CWE и локального анализа закрытых репозиториев — как дополнительный слой рядом с SAST, SCA, DAST и ручным аудитом. Независимых прогонов VLoc Bench, проверки утечки данных и нормализованных измерений стоимости, памяти и производительности пока нет, поэтому заявления о превосходстве и эффективности остаются результатами самой Cisco. 🌚 @poxek_ai / Чат канала
PWN AI - небезопасный ИИ
PWN AI - небезопасный ИИ
🔒Открыть пост
и посмотреть медиа
Последние два года мы много экспериментировали с доступными guardrail-моделями. Сравнивали готовые решения, обучили несколько собственных моделей, собирали и адаптировали бенчмарки, чтобы понять, как вообще правильно сравнивать качество защиты. Сравнения по одной метрике недостаточно: какая-то модель лучше ловит опасные запросы, но чаще блокирует легитимные, большие модели имеют более высокий F1-score, но дороже в инференсе и имеют больший latency. В итоге наши наработки мы собрали в GuardRate Leaderboard, где можно сравнивать guardrail-модели по разным параметрам и смотреть на эти trade-offs, настраивая параметры под нужный кейс использования. Ссылка на лидерборд: Ссылка скрыта Подробнее про подход, методологию и наши находки читайте на Хабре: Ссылка скрыта Дорогие конкуренты и игроки рынка AI Security, если вы обучаете свои guardrail-модели и хотите увидеть их на лидерборде, напишите нам. Будем рады добавить и прогнать их по тем же тестам, что и остальные модели и услышать вашу обратную связь. Со временем мы автоматизируем этот процесс, но пока добавляем новые модели по запросу. Поздравляю Софью Балаба с первым релизом ⭐️ и большое спасибо Никите Облакову, Антону Малыхину и Сабрине Садиех за кропотливую работу над тем, чтобы сделать нашу исследовательскую работу публичной 🎉.
PWN AI - небезопасный ИИ
Subscriber dynamics
+0.2% last 30 days
Current
7,180
Month ago
7,169
Average growth
+0 / day
Updated
1 day ago

Reviews for channel PWN AI - небезопасный ИИ

Log in to leave a review

Only registered users can share their opinion.

No reviews yet

Be the first to share your impression of this resource!

Similar resources

Leasing of KAMAZ vehicles from the manufacturer in Uzbekistan.

Channel

Fresh newsIT, rumors, photos, videos and useful tricks on technology and security.

Channel

Official English ChannelBinance Futures: news, announcements and tools for trading futures onBinance.

Channel
Switch to Light Theme
Home Catalog Collections Blog Login