17 Aug 2026, 17:20 UTC757 views17 reactions5 Starsread 20 August 2026 Хочу вам напомнить, что есть папка замечательных, на мой взгляд, каналов по AI Security
https://t.me/addlist/KQ6ZpCqAO-I1NmUy
Надо добавить к себе 😒
custom 54453177429891578349custom 52764179693903628004custom 54474801559434927244
Signed Artyom Semenov
16 Aug 2026, 12:56 UTC≈6,930 views25 reactions10 Starsread 20 August 2026 Photo
Почему изолировать reasoning модели в обычном Docker уже бесполезно
Кажется, что если засунуть LLM с доступом к шеллу в обычный Docker-контейнер, хост будет в полной безопасности. Однако в AI Security Institute так не считают. Авторы выкатили в марте SandboxEscapeBench на фреймворке Inspect и наглядно показали что для современных reasoning-моделей дефолтный контейнер - как простая таска для разминки, а на успешный …
custom 593848252661917979811custom 54453177429891578348custom 53844532846961819126
Signed Artyom Semenov
14 Aug 2026, 09:59 UTC927 views9 reactions5 Starsread 20 August 2026 Forwarded from @borismlsecPhoto
Инцидент OpenAI - Hugging Face — что «забыли» объяснить?
#иб_для_ml
У OpenAI недавно произошел исторический инцидент - AI-агенты сбежали из компании и поломали другую компанию, HuggingFace. Получается, вот он, Скайнет?
Про инцидент, конечно, всем известно. Но все про него так восторженно говорили...
А может, все еще не так страшно? Я решил разобраться, какие несостыковки есть в рассказе самой открытой AI-компании…
custom 54453177429891578344custom 59384825266191797983custom 54474801559434927242
Signed Boris Protoss
13 Aug 2026, 16:38 UTC≈1,020 views7 reactions10 Starsread 20 August 2026 Posted without readable text
custom 54453177429891578345custom 52764179693903628001custom 59384825266191797981
Signed Artyom Semenov
8 Aug 2026, 10:43 UTC≈1,380 views7 reactionsread 20 August 2026 Forwarded from @poxek_aiPhoto
Cisco Antares: SLM для локализации уязвимого кода
Cisco представила Antares — семейство SLM для поиска файлов с известной уязвимостью внутри репозитория. Выпущены Antares-350M и Antares-1B; Antares-3B пока только готовится. Ставка сделана на узкую задачу, локальный запуск и меньшие вычислительные требования по сравнению с универсальными моделями. Наконец по настоящему SLM, а не вот эти 30b или даже больше, которыми …
custom 54453177429891578345custom 52764179693903628001custom 54474801559434927241
Signed Artyom Semenov
7 Aug 2026, 18:21 UTC≈1,100 views5 reactions1 Starread 20 August 2026 Forwarded from @kokuykin
Последние два года мы много экспериментировали с доступными guardrail-моделями. Сравнивали готовые решения, обучили несколько собственных моделей, собирали и адаптировали бенчмарки, чтобы понять, как вообще правильно сравнивать качество защиты. Сравнения по одной метрике недостаточно: какая-то модель лучше ловит опасные запросы, но чаще блокирует легитимные, большие модели имеют более высокий F1-score, но дороже в ин…
custom 54453177429891578345
Signed Artyom Semenov
3 Aug 2026, 20:31 UTC≈5,460 views16 reactions20 Starsread 20 August 2026 Posted without readable text
custom 544531774298915783411custom 59384825266191797983custom 54474801559434927242
Signed Artyom Semenov
2 Aug 2026, 18:55 UTC≈2,790 views21 reactions5 Starsread 20 August 2026 Posted without readable text
custom 544748015594349272416custom 58076543223846711283custom 52764179693903628002
Signed Artyom Semenov
31 Jul 2026, 15:47 UTC≈1,700 views9 reactions12 Starsread 20 August 2026 Количество инцидентов с AI-агентами растет лавинообразно.
И вот я обнаружил интересный репозитории awesome-ai-agent-attacks, в котором собрана хронология реальных взломов ИИ и уязвимостей AI-агентов за 2024–2026 годы. Только факты, даты, первопричины и ссылки на источники.
Такие репозитории и раньше были, но тут словно полная коллекция, очень много знакомо для меня и так или иначе мелькало перед глазами.
А вот нес…
custom 54453177429891578347custom 54474801559434927241custom 58076543223846711281
Signed Artyom Semenov
29 Jul 2026, 19:23 UTC≈1,400 views7 reactions10 Starsread 20 August 2026 Forwarded from @okmlai
Математика категорий и ИИ
Любишь читать академичные лонгриды с сомнительной практической пользой? Тогда этот пост для тебя!
О теории категорий обычно говорят как об одной из самых абстрактных областей математики. Довелось прочитать популярную книгу «Восторг абстрактной математики» Юджении Ченг (вслух тебе её прочитают на ютубе, можешь купить на озоне за 4к и в целом за год достаточно прочитать только ее, чтоб собой…
custom 54453177429891578344custom 53844532846961819121custom 54474801559434927241custom 54744858021991674721
Signed Artyom Semenov
27 Jul 2026, 18:10 UTC≈1,540 views6 reactionsread 20 August 2026 Forwarded from @b0tleg
Не зря я вёл канал про безопасность агентных платежей практически год, ведь недавно вышла отличная статья о безопасности платёжных агентов. Самые критичные риски кроются в протоколах связи между агентом и сервисом.
В чем суть? Успех семантической атаки зависит от того, поддастся ли модель манипуляции. Структурная же атака срабатывает всегда (вероятность успеха - 100%), независимо от того, что под капотом: легкая и д…
custom 54453177429891578346
Signed Artyom Semenov
26 Jul 2026, 15:12 UTC≈1,660 views6 reactionsread 20 August 2026 А ещё давно я не просил у вас бустов в канал https://t.me/boost/pwnai
😒
custom 54474801559434927245custom 53844532846961819121
Signed Artyom Semenov
Showing the 12 most recent of 26 posts we hold for @pwnai. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.