30 Aug 2026, 11:29 UTC489 views9 reactionsread 3 September 2026 Forwarded from @ai_machinelearning_big_dataVideo
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3
Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.
Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.
Идея в том, чтобы у языковой модели была устойчив…
👍4❤3🔥2
26 Aug 2026, 07:02 UTC≈1,100 views3 reactionsread 3 September 2026 Photo
🔥 Prime Agent выпустили технический отчёт
"Prime Agent: A Self-Improving RLM Harness"
В работе подробнее разобрана архитектура Prime Agent и его роль как harness для долгих agentic-оценок.
Один из самых интересных экспериментов - Factorio:
- 7 дней непрерывной траектории на Sonnet 5
- 23,4 млн output tokens
- завершено 24 из 196 технологий
- ещё 71% прогресса до следующей технологии
- 633 запущенных subagents
- м…
🔥3
25 Aug 2026, 15:01 UTC≈1,190 views11 reactionsread 3 September 2026 Photo
🤯 Локальные AI-модели становятся пугающе мощными
Qwen3.8-27B вошла в топ-10 рейтинга Arena WebDev, оказавшись всего в нескольких позициях от моделей, которые больше неё на порядки.
Модель всего на 27 млрд параметров, которую можно запускать локально.
Ещё недавно такие возможности требовали огромных облачных моделей и дорогой инфраструктуры.
Теперь open-source модели начинают конкурировать с лидерами рынка прямо н…
🔥6❤4🥰1
25 Aug 2026, 10:05 UTC≈1,040 views8 reactionsread 3 September 2026 Photo
🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы?
Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага.
Учёные проверили агентов на задачах из открытых научных репозиториев:
* публичные тесты можно использовать для итераций;
* скрытые тесты показывают, действительно ли проблема решена.
Результат удивляет:
Claude Code с Opu…
👍5❤2🔥1
23 Aug 2026, 14:48 UTC≈1,350 views12 reactionsread 3 September 2026 Photo
У Microsoft вышла очень показательная работа про надёжность AI-агентов.
Лучший агент в эксперименте смог успешно выполнить 91% бизнес-задач хотя бы один раз.
Но если требовать, чтобы он выполнял ту же задачу правильно каждый раз, показатель падал до 25%.
И есть ещё более неприятная часть.
В 4 из 5 неудачных запусков агент:
— вежливо завершал работу
— вызывал инструмент записи в базу
— сообщал, что всё выполнено
…
❤6👍4🔥2
23 Aug 2026, 10:11 UTC971 views2 reactionsread 3 September 2026 Photo
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://t.me/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rus…
❤2
19 Aug 2026, 12:28 UTC≈4,370 views12 reactionsread 3 September 2026 Photo
Бесплатная книга по performance engineering
В Algorithmica хорошо разобрали, почему классическая оценка сложности всё хуже отражает реальную производительность на современном железе.
Раньше модель была довольно логичной: процессор выполняет инструкции почти последовательно, у каждой есть своя стоимость, а значит можно примерно оценить время работы алгоритма количеством операций.
Потом всё упростили до асимптотики.…
❤7👍4🥰1
18 Aug 2026, 09:46 UTC≈1,410 views3 reactionsread 3 September 2026 Photo
🔥 Год production-трафика показал: быстрый LLM-serving начинается не со scheduler, а с понимания поведения пользователей
Исследователи из Harvard и University of Chicago проанализировали год production-трафика Chutes - миллиарды запросов к тысячам моделей. Главный вывод: реальные LLM-нагрузки сильно меняются со временем, поэтому короткие synthetic benchmarks дают слишком упрощённую картину.
Пользователь часто возвр…
❤3
15 Aug 2026, 11:12 UTC≈1,560 views14 reactionsread 3 September 2026 Photo
⚡️ Harness Engineering - полный курс на русском
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовы…
❤6👍5🔥3
13 Aug 2026, 13:56 UTC≈1,420 views12 reactionsread 3 September 2026 Forwarded from @data_analysis_mlPhoto
🔥 Нашёл отличный бесплатный ресурс по Harness Engineering - тому, что делает coding agents реально надёжными
Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.
Разбирают:
* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны AGENTS.md, feature_list.json и progress-файлы;
* ка…
🔥8👍3🥰1
11 Aug 2026, 13:25 UTC≈1,740 views17 reactionsread 3 September 2026 Photo
🧠 Любишь ложиться поздно? Исследования действительно находили связь между «совами» и более высокими результатами когнитивных тестов, но всё не так просто.
В работе 2009 года исследователи проанализировали данные более 10 тысяч человек и обнаружили: участники с более высокими результатами тестов интеллекта в детстве чаще становились взрослыми, которые позже ложатся и позже встают.
Авторы объясняли это через гипотезу…
❤7👍5😁3👎1🔥1
28 Jul 2026, 10:27 UTC≈2,410 views22 reactionsread 3 September 2026 Photo
Qwen научила модель создавать себе учебную программу
Команда Qwen представила Skill Self-Play - подход, в котором LLM сама генерирует задания, решает их и постепенно расширяет библиотеку проверенных навыков.
Проблема обычного self-play: модель либо остаётся в узких средах с простой проверкой, либо создаёт много разнообразных, но ненадёжных задач.
В Skill-SP работают три компонента:
proposer придумывает сложные за…
👍9❤8🔥5
Showing the 12 most recent of 28 posts we hold for @machinelearning_books. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.