13 Aug 2026, 11:41 UTC≈1,390 views14 reactionsread 20 August 2026 Context-1 — поисковый агент, который умеет избавляться от лишнего. Часть 1/2
Авторы сегодняшней статьи заявляют следующую проблему. Когда агент ищет что-то в поиске, то нерелевантные страницы, выданные браузером, всё равно остаются в контексте агента. Чтобы справиться с этим, контекст можно обрезать или суммировать.
Ещё одно весьма перспективное направление в этой области — self-editing context, при котором модель …
❤5🔥5❤🔥3🤮1
6 Aug 2026, 12:28 UTC≈2,350 views19 reactionsread 20 August 2026 Photo
Как агенты оценивают собственный успех
Представим ситуацию: инженеру нужно починить баг в сервисе аутентификации с помощью кодового агента. До начала работ агент сообщает, что вероятность успеха — 72%. По ходу работы меняет мнение на 78%, после всех изменений — 92%, а какой-нибудь AI-ревьюер пророчит положительный результат с вероятностью 85%. Однако по итогу патч, сделанный агентом, не работает — то есть прогнозы о…
❤8🔥8❤🔥3
31 Jul 2026, 08:42 UTC≈2,690 views24 reactionsread 20 August 2026 Photo
AgentFold — метод управления контекстом для агентов на длинных задачах
На длинных сценариях поиска и анализа веб-агенты либо хранят слишком много сырой информации, либо слишком часто её суммаризируют, что забивает контекст. Авторы сегодняшней статьи предлагают метод AgentFold (GitHub), призванный решить эту проблему, сделав память агента динамической и управляемой самим агентом.
Сейчас в веб-поиске используются два…
❤🔥10👍9❤3🔥2
21 Jul 2026, 09:12 UTC≈2,600 views18 reactionsread 20 August 2026 File
Asynchronous Reasoning: Training-Free Interactive Thinking LLMs
Сегодня поговорим о статье, в написании которой принимали участие инженеры Яндекса. Публикация посвящена асинхронному ризонингу, а в её основе лежит метод, описанный в работе Hogwild! Inference: Parallel LLM Generation via Concurrent Attention, поэтому сперва — кратко о ней.
Это тоже статья от Yandex Research, а также от HSE и IST Austria. Авторы поста…
🔥13❤3👍2
17 Jul 2026, 09:40 UTC≈3,890 views26 reactionsread 20 August 2026 Photo
Тренды из мира бенчмарков на ICML 2026 [2/2]
SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
Ребята из Nebius расширили свой SWE-rebench на новые языки: сфокусировались на масштабируемости и пригодности для сбора RL-лёрна. Две ключевые части пайплайна: сборка окружения под каждый репозиторий и отбор задач для тестов.
Окружение собирают собственным интерактивным агентом. Он читает README или конфиги …
❤🔥10🔥8❤7🤩1
17 Jul 2026, 09:40 UTC≈1,740 views14 reactionsread 20 August 2026 Photo
Тренды из мира бенчмарков на ICML 2026 [1/2]
Работ о бенчмарках на ICML традиционно много. По сравнению с прошлым годом, в 2026 стало заметно больше бенчей для агентов. А ещё начали чаще встречаться работы из академии.
Объяснение простое. Корпорации вкладывают много сил во внутренние бенчи: делают сами, покупают их у data-labeling-компаний (например, Surge, Mercor, Handshake AI, Toloka) — и, как следствие, такие бе…
👍7❤4❤🔥2🔥1
16 Jul 2026, 09:57 UTC≈1,800 views26 reactionsread 20 August 2026 Photo
ICML 2026 — личные впечатления
Конференция закончилась, но говорить о ней можно ещё долго. Сегодня личными впечатлениями с нашим каналом поделился старший разработчик команды инфраструктуры обучения Alice AI Владислав Тыцкий.
Конференция ощущалась очень масштабной: много людей, огромные залы для докладов, плотное расписание и буквально бесконечное количество постеров. Иногда возникало ощущение, что между интересным…
❤13👍6❤🔥5🔥2
14 Jul 2026, 08:30 UTC≈1,960 views23 reactionsread 20 August 2026 Photo
Подборка об RL и ризонинге
Рассказываем об улучшении RL для сложных задач, оптимизация в RLVR одной строкой кода (!) и обучении компактной модели для дипресёрча.
Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes
При обучении RL на сложных задачах есть две основные проблемы:
1. Большинство роллаутов — wrong, поэтому положительные примеры для основной части задач не появляютс…
❤11❤🔥4👍4🔥4
13 Jul 2026, 10:34 UTC≈1,730 views25 reactionsread 20 August 2026 Photo
Ещё больше классных постеров из Сеула — по следам ICML 2026
RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents
Сейчас очень много агентов работает в ReAct парадигме (последовательные reasoning + acting). Авторы считают, что такой подход с длинными линейными цепочками плохо подходит для сложных задач, потому что deep search больше похож на дерево гипотез: модель может наметить несколько веток, но потом…
❤13🔥5👍4🤩2👀1
Showing the 9 most recent of 9 posts we hold for @stuffyNLP. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.