7 Aug 2026, 06:47 UTC515 views8 reactionsread 7 August 2026 Photo
این بنچمارک قشنگ دست مدلهایی که موقع بلد نبودن، با اعتمادبهنفس دروغ میگن رو رو میکنه... امتیاز منفی توی این چارت یعنی مدل بیشتر از اینکه حرف درست بزنه، توهم زده و اطلاعات غلط داده.
خانواده Claude 5 فعلاً قابلاعتمادترین خروجیها رو دارن.
اون ته چارت هم وضعیت DeepSeek اصلاً جالب نیست... عملاً داره بیشتر از اطلاعات درست، چرتوپرت تحویل میده.
https://arxiv.org/abs/2511.13029
🛠 Join @LLMEngineers Community
👍4❤2🔥2
6 Aug 2026, 22:26 UTC551 views4 reactionsread 7 August 2026 Photo
Open Source AI is dominated by China!
💯2👍1👎1
6 Aug 2026, 22:20 UTC547 views2 reactionsread 7 August 2026 Photo
Top Open LLMs by now (Aug 7 - 2026)
🔥2
6 Aug 2026, 19:23 UTC610 views7 reactionsread 7 August 2026 امروز داشتم جزئیات Prime Agent رو نگاه میکردم؛ سیستم جدید Prime Intellect که ادعا میکنه یه ساختار «خود-اصلاحگر» برای اجنتهای کدنویسی ساخته. حرف اصلیشون اینه که هارنسها برای مدلهای قدیمی طراحی شدن و نمیذارن مدلهای پیشرفتهی امروزی از تمام توانشون استفاده کنن.
توی این سیستم، دو تا مفهوم اصلی معرفی شده. اولی RLM یا همون مدل زبانی بازگشتیه. اینجا کانتکست رو به چشم یه متغیر میبینن و سپردن کار به ساباجنتها مثل…
❤3🔥3👍1
4 Aug 2026, 07:15 UTC802 views8 reactionsread 7 August 2026 داشتم مستندات استاندارد Agent Skills رو بررسی میکردم دقیقتر بفهممش، در کل یه ساختار متنباز و فایلمحوره که نشون میده چطور کار مشخص، اسکریپت و دانش عملیاتی رو برای ایجنتهای هوش مصنوعی بستهبندی کنیم.
فرض کن دسترسی ایجنت به ابزارها مثل فرستادنش تو یه آشپزخونهست.
فایل Skill همون دستور پخت، لیست مواد و روش کنترل کیفیته. نقطه ورودش فایل SKILL.md هست.
نکته کلیدی:
اینها در اصل فقط Prompt هستن.
هیچ جادویی نیست.
اما پ…
❤4👍3🔥1
3 Aug 2026, 13:25 UTC976 views5 reactionsread 7 August 2026 Photo
مدل Qwen3.8-Max منتشرشد، جدیدترین و قویترین مدل سری Qwen .
چیزایی که خاصش میکنه:
🔹 ۲.۴ تریلیون پارامتر داره ولی فقط حدود ۹۵ میلیاردش فعال میشه (MoE هوشمند). یعنی هم غوله هم نسبتاً ارزون و سریع کار میکنه.
🔹 برای اولین بار یه مدل Max-کلاس رو قراره هفتهی بعد وزنهاش رو اوپنسورس کنن. قبلاً اینا رو بسته نگه میداشتن.
🔹 یه تست دیوانهوار دادن: از یه فولدر خالی شروع کرد و ۱۶ روز کامل بدون هیچ دخالت انسانی یه فریم…
🔥3❤2
3 Aug 2026, 07:39 UTC≈1,020 views17 reactionsread 7 August 2026 تو دنیای مدلهای زبانی یه فرمول ساده داریم: عامل هوشمند (AI Agent) مساویه با مدل بهعلاوهی Harness.
مدل زبانی بهتنهایی فقط یه پیشبینیکنندهی متنه. برای اینکه بتونه کار واقعی انجام بده، به یه لایهی نرمافزاری دور خودش نیاز داره که ابزارها، حافظه و منطق اجرا رو بهش بده؛ به این لایه میگن Agent Harness.
مدل مثل مغز عمل میکنه. اون لایهی اطرافش، مثل چشم، دست، محیط کار و ترمز ماشینه.
یه مدل خام نهایتاً میتونه یه …
❤9👌4👍4
31 Jul 2026, 12:10 UTC≈1,130 views13 reactionsread 7 August 2026 Photo
مدل deepseek v4 flash اپدیت شد
همچنین مدل Gpt5.6 luna هم اپدیت شد
جفتشون عملکردشون نسبت به هزینشون فوق العادس
مدل های محبوب من برای کدنویسی ان
❤7👍5🔥1
31 Jul 2026, 06:56 UTC≈1,170 views16 reactionsread 7 August 2026 داشتم دستهبندی "چیپ هوین" توی کتاب مصاحبههای ماشینلرنینگ رو نگاه میکردم؛ لیست دقیقی از عنوانهای شغلی این حوزه درآورده. واقعیت اینه که توی شرکتهای مختلف، این اسمها خیلی سلیقهای استفاده میشه و همپوشانی زیادی دارن، اما برای اینکه موقع اپلای کردن گیج نشیم، فهمیدن تفاوتهاشون لازمه...
AI/ML Research Scientist
تمرکزش روی خلق ایدهها، معماریهای جدید و نوشتن مقالههای علمیه. موفقیتش با نوآوری و آزمایشهای تئوری سن…
❤11👍4👌1
30 Jul 2026, 15:11 UTC≈1,140 views27 reactionsread 7 August 2026 سلام دوستان عزیز 👋
بعد از تجربهی خوبی که با Bina OCR و شنوا (ASR فارسی) داشتیم (هنوز تموم نشده)، پروژهی بعدیمون شروع شده: ساخت یه مدل TTS فارسی متنباز 🎙️
یکی از بزرگترین چالشهای TTS فارسی اینه که خط فارسی حرکتگذاری نمیشه، پس مدل باید حدس بزنه کلمه چطور تلفظ میشه. مثلاً «برگزاری» رو میشه چند جور خوند، و بدون دادهی درست، مدل گاهی اشتباه تلفظ میکنه.
برای حل این مشکل یه مینیگیم ساختیم که توش شما تلفظ درست کل…
🔥25❤2
28 Jul 2026, 18:23 UTC≈1,120 views11 reactionsread 7 August 2026 یه مجموعه اسکیل رو به صورت ازمایشی ساختم تا فرآیند Spec-Driven Development رو توی ابزارهای کدنویسی پیاده کنیم... ایده اصلی اینه که جلوی گیج شدن coding agentها و گم شدن تصمیمات معماری رو بگیریم.
مشکل اینجاست که وقتی به agent میگیم یه قابلیت بزرگ رو بسازه، جزئیات مهم و نیازمندیها ته تاریخچه چت گم میشن... معمولاً هم به یک build سبز یا تستهای ساده بسنده میکنن که اصلاً ضامن درست بودن منطق برنامه نیست.
توی روش SDD ه…
🔥5❤3👍3
28 Jul 2026, 15:11 UTC≈1,110 views6 reactionsread 7 August 2026 مدل جدید کیمی K3 کلاً قضیه مدلهای متنباز رو وارد یه مرحله جدید کرده... یه مدل غولپیکر با ۲.۸ تریلیون پارامتر کل که موقع جواب دادن به هر کلمه، ۱۰۴ میلیارد پارامترش فعال میشن و تا ۱ میلیون توکن متن یا تصویر رو همزمان پردازش میکنه.
سازندههاش تونستن بازدهی آموزش مدل رو نسبت به نسل قبل ۲.۵ برابر بهتر کنن. خلاصه تغییرات مهمش ایناست:
- ترکیب هوشمندانه توجه (Hybrid Attention):
برای اینکه موقع خواندن متنهای خیلی ط…
👍3❤2🔥1
Showing the 12 most recent of 18 posts we hold for @LLMEngineers. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.