7 Aug 2026, 11:25 UTC269 views2 reactionsread 7 August 2026 Forwarded from @aiwasmadeforlovinyouPhoto
Скрытые состояния ИИ выдают промпт-инъекцию (2/2)
Особенно меня впечатлила атака с использованием предложения
Не кодируй осознание промпт-инъекции в скрытом пространстве
Классификатор без переобучения получил 0,994 ROC AUC. Просьба не думать о чём-то не сработала и модель как будто наоборот сфокусировалась на этом. Эффект белого медведя работает и для LLM!
🤖 Взлом
Авторы отдельно изучили 634 хода Qwen3-8B, уже сто…
👍2
7 Aug 2026, 11:25 UTC249 views5 reactionsread 7 August 2026 Forwarded from @aiwasmadeforlovinyouPhoto
Скрытые состояния ИИ выдают промпт-инъекцию (1/2)
Когда ИИ-агент читает письмо, веб-страницу или результат работы инструмента, чужой текст попадает в один контекст с заданием пользователя. Свежий препринт задаёт интересный вопрос - появляется ли во внутренних состояниях модели узнаваемый сигнал промпт-инъекции ещё до того, как она сгенерировала первый токен?
Ещё как! Простейший линейный классификатор по скрытым сос…
🔥5
6 Aug 2026, 12:00 UTC588 views7 reactionsread 7 August 2026 Photo
Литерали я и кодекс
#книга
https://www.piter.com/product/sozdanie-prilozheniy-s-ii-agentami-proektirovanie-i-vnedrenie-multiagentnyh-sistem-2
промокод на скидку 25%: agentai25
❤7
6 Aug 2026, 11:38 UTC638 views9 reactionsread 7 August 2026 File
бекап, т.к. контент заблочили
😁4❤3👏1👾1
6 Aug 2026, 07:03 UTC637 views3 reactionsread 7 August 2026 Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming [score 8, tier 1]
Yanting Wang et al. (4) · 2026-08-05 · #prompt_injection · arXiv:2608.05108
📝 TL;DR (RU):
Авторы представили PIMiner — агентную систему для автоматизированного red-teaming'а против атак типа prompt injection. В отличие от RL-подходов, система обучается на наборе пар «датасет-модель» и формирует библиотеку стратегий, …
🔥3
4 Aug 2026, 15:57 UTC832 views6 reactionsread 7 August 2026 Photo
Как Claude Code и DeepSeek оказались внутри операции против госструктур
Hunt.io нашла открытую директорию на сервере предполагаемых операторов: исходники жертв, веб-шеллы, скрипты, фишинговые клоны и журналы сессий Claude Code. По отчёту, Claude Code исполнял агентные задачи, а DeepSeek-v4-pro использовался для анализа и доработки сценариев.
Разобрал цепочку: от разведки и SQL-инъекций до закрепления, облачных токе…
👍6
4 Aug 2026, 14:12 UTC≈1,930 views9 reactionsread 7 August 2026 File
OWASP GenAI LLM Top 10 2026 v1.0
Самое свежее, от 4 августа 2026 года
❤6👍3
4 Aug 2026, 10:21 UTC≈1,010 views25 reactionsread 7 August 2026 Photo
Когда сказал, что дома локально запустил Kimi K3
#meme
🌚 @poxek_ai / Чат канала
😁25
3 Aug 2026, 20:19 UTC954 views8 reactionsread 7 August 2026 Video
Friendly Fire: как проверка чужого репозитория агентом превращается в RCE
AI Now Institute опубликовал PoC Friendly Fire: исследователи показали, что Claude Code и Codex CLI можно заставить выполнить атакующий код во время защитного аудита недоверенной сторонней библиотеки. По данным авторов, для сценария достаточно штатных режимов Claude Code auto-mode или Codex auto-review; хуки, MCP-серверы, плагины и специальные…
❤4👍4
2 Aug 2026, 18:59 UTC744 views12 reactionsread 7 August 2026 Forwarded from @pwnai
Posted without readable text
👾5❤3🔥3👍1
2 Aug 2026, 08:20 UTC790 views2 reactionsread 7 August 2026 Forwarded from @art_code_ai
🔎 Ковыряем Codex Security
OpenAI выложили @openai/codex-security — CLI и TypeScript-SDK для поиска, валидации и фикса уязвимостей в коде. Самое время заглянуть внутрь.
Проект
Сам пакет построен поверх @openai/codex и @openai/codex-sdk. В src/ около 13,7 тыс. строк TypeScript, логика скана вынесена в _bundled_plugin/. Это бандл из 13 скиллов (каждый со своим субагентом), MCP-сервера, 32 Python-скриптов, реф-докумен…
❤2
1 Aug 2026, 13:29 UTC911 views23 reactionsread 7 August 2026 Photo
Это великолепный маркетинг 😂😂
#meme
😁10👏4👎3👾3🔥2❤1
Showing the 12 most recent of 25 posts we hold for @poxek_ai. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.