18 Aug 2026, 21:05 UTC≈1,260 views28 reactionsread 29 August 2026 Forwarded from @per3onnel
چون به این علاقه داشتید و share کردید (بیش از ۴۰۰ بار)
گفتم براتون یک آموزش دیگه هم بذارم؛
این یکی برای اونهایی که به deep learning علاقهدارند تازه شروع کردند یا میخوان شروع کنند و مباحث زیاد هست و پیشنیازها بیشتر.
Carnegie Mellon University Deep Learning
من این کانال رو چندسالی هست که خودم دنبال میکنم؛ همینجا بگم که بهترین لهجه انگلیسی توی این کانال نیست اما یک نگاهی به ویدئوهای اخیرشون برای دوره
Intro to d…
❤25👍3
2 Aug 2026, 09:27 UTC≈2,500 views21 reactionsread 29 August 2026 Forwarded from @per3onnel
در ادامه پروسههای باگ یابی من از شرکتهای هوش مصنوعی.
الان متوجه شدم چرا خیلی از بچهها میگن که فقط با Claude میتونند کد بزنند؛ من یک باگ جدید پیدا کردم.
Qwen, Grok, ChatGpt, GLM5.2
رو تست کردم؛ این مدلهای پارسر ضعیفتری دارند.
اول اینکه بنظر میاد همشون کد رو هم مثل markdown باهاش برخورد میکنند و پارس میکنند چرا ؟
حجم زیادی کد بهشون دادم با پرامپت سختگیرانه (خیلی بیادبی هست وگرنه میذاشتم) و همشون چون رو حالت سخ…
👍12❤9
1 Aug 2026, 19:11 UTC≈2,330 views7 reactionsread 29 August 2026 Forwarded from @per3onnel
زده من اینکار رو کردم بعدش دیگه چه کارهایی میشه کرد باهاش ؟
هیچی تلاش کردی چندتاش رو بهم وصل کنی ببینی چی میده یا اصلا چطوری باید کد بزنی برای اتصال چندتاش به هم دیگه ؟
سریعتر میشه؛ کندتر میشه ؟
حالا bottleneck کجاس ؟
اگر مدل بزرگتر باشه چی میشه ؟
اصلا چطوری میشه چندتاش رو بهم وصل کرد (کارت شبکه که نداره)
مدل P4 که روی RiscV هست چطوری کار میکنه ؟
اگر همه این کارها رو کردی و جواب همش رو درست متوجه شدی یک سری به این…
👍6❤1
31 Jul 2026, 10:29 UTC≈2,540 views24 reactionsread 29 August 2026 Forwarded from @per3onnel
لطفا ایشون رو برای همکاری استخدام کنید
AI developer runs 28.9-million-parameter model on $10 ESP32-S3 microcontroller — uses Google's Per-Layer Embeddings technique, stores table on 16MB Flash memory
اگر انقدر دیوونه هست که جنین کدی رو توی وقتهای خالی خودش بزنه؛ ببین توی کار چه کدهایی میزنه.
پینوشت:
خروجیش ۱ توکن در ثانیه هست مهم کاری هست که کرده و کدی که زده
👍21❤3
28 Jul 2026, 08:19 UTC≈2,960 views14 reactionsread 29 August 2026 Forwarded from @per3onnel
Claude Leak
داستان چیه ؟ یک اتفاق تکراری دیگه.
هرکسی روی Calude چت خودش رو لینک Share براش گرفته چت بصورت کامل عمومی شده.
یک نفر هم اومده توی گوگل زده
site:claude.ai/share
و دیده بله گوگل تمام و کمال همرو ایندکس کرده.
که خب یعنی خیلی شرکتهای دیگه هم اینکار رو کردند و البته خیلی جاهای دیگه هم دیتاهای مهم رو خوندند.
خیلی از بیزینسها ابراز نگرانی کردند و گوگل نتایج رو حذف کرد و گفته میشه که کلاد هم باگ رو برطرف کرد…
👍13❤1
26 Jul 2026, 12:21 UTC≈2,880 views20 reactionsread 29 August 2026 Forwarded from @per3onnel
این رو معرفی کنم
OKF (by google)
وقتی مدلها با کانتکستهای بالای 128K و حالا بیش از 1M استاندارد شدند واقعا هزینه توسعه و نگهداری سیستمهای RAG برام قابل درک نبود.
توی یک سری از ابزارهای چت شما میتونید مشخص کنید چت با چه پیامهایی از قبل مشخص شدهای شروع بشه و ماهم از همین تکنیک استفاده میکردیم.
مثلا برای نیروهای تازه وارد به شرکت؛ شماتیک دیتابیس رو توی چت اول میذاشتیم و نیرو همزمان با خوندن کدها اگر سوالی روی دیت…
👍15❤5
14 Jul 2026, 11:42 UTC≈3,200 views19 reactionsread 29 August 2026 Forwarded from @per3onnel
مدلهای MoE خیلی جذابتر از مدلهای Dense هستند بنظرم چون میتونی یک مدل خیلی بزرگتر رو روی یک GPU خیلی کوچکتر با سرعت بالا اجرا کنی مثل :
https://telegram.me/per3onnel/263
یک سری افراد نشستند و همین کار رو برای GLM.5-2 با فشرده سازی و اپیتیمایز کردن بسیار انجام دادند بطوری که طبق ادعا خودشون مدل 774 میلیارد پارامتری رو روی سیستم با 25GB رم و بدون نیاز به GPU اجرا کردند (همه چیز روی C نوشته شده)
بطور خیلی ساده کاری…
❤17👍2
14 Jul 2026, 09:25 UTC≈3,240 views21 reactionsread 29 August 2026 یک پستی از دوست و همکار قدیمی توی لینکدین دیدم راجب یک کتابی که درحال نوشته شدن و تکمیل هست مخصوص کسانی که به
Deep Learning + Rust
علاقمند هستند گفتم اینجا هم به اشتراک بذارم
Linked In
شخصا درحال خالی کردن وقت برای خوندنش هستم چون موارد جالبی پوشش داده شده
مثلا اینکه بدون نیاز به سیستمعامل بتونید کار دیپلرنینگ انجام بدید چیزی نیست که روی فریمورکها و پایتون و ... آموزش داده بشه
❤16👍5
12 Jul 2026, 15:01 UTC≈2,170 views14 reactionsread 29 August 2026 Forwarded from @per3onnelPhoto
LLM
قراره جای برنامه نویسهارو بگیره ؟
من که کدم رو + دستورالعمل ریفکتور دادم تا برام تمیز کنه و خروجی که توی تصویر هست
نصف باگهای مدلهای LLM رو من درآوردم باید بهم هزینه پرداخت کنند واقعا
پینوشت:
تازه ۳۵ دقیقه هم طول کشید. خودم میزدم ۲۰ دقیقهای تموم میشد.
👍11❤3
12 Jul 2026, 14:13 UTC≈2,880 views12 reactionsread 29 August 2026 Needle: We Distilled Gemini Tool Calling into a 26M Model
این مدل برای تخصصی برای tool calling ساخته شده؛ من جایگزین مدل ۴ میلیارد پارامتری کردم و همچنان به درستی از ابزارهایی که داشتم استفاده میکنه.
البته ابزارهای من ساده و قدیمی هست (خیلی وقت هست از این پروژه استفاده نکردم) اما بنظرم مدلی هست که ارزش تست کردن داشته باشه واقعا؛ اگر برای tool calling نیاز به مدل دارید یک تستی هم روی این انجام بدید اما بیشتر از too…
👍10❤2
6 Jul 2026, 17:10 UTC≈3,000 views12 reactionsread 29 August 2026 Forwarded from @per3onnel
95% of enterprise AI deployments fail to deliver value
در یک حرکتی چندتا از این شرکتهای AI فروش داخلی (کاسبان تحریم) روی موجهای اخیر درحال تلاش برای خوروندن LLM به شرکتهای دیگر هستند. شرکتهایی که همینطوری بخاطر تحریم؛ جنگ؛ قطعی اینترنت و تعطیلی به زور سرپا موندند.
برای همین خواستم دوتا مورد رو یادآوری کنم:
اولین مورد گزارش MIT روی میزان سودآوری AI (که ۹۵٪ میزان بازگشت 0 داشتند)
legal.io
مورد دوم؛
تجربه شخصی …
👍9❤3
25 Jun 2026, 18:06 UTC≈3,990 views13 reactionsread 29 August 2026 Forwarded from @per3onnel
نسل بعدی مدلها بنظرم خیلی بهتر خواهند شد :
Qwen AgentWorld
بنظرم این حرکت در راستای JEPA خواهد بود و این Gap بین LLM و JEPA رو برای مدتی میپوشونه تا نتایج مدلهای بر پایه JEPA خیلی بهتر بشه.
❤10👍3
Showing the 12 most recent of 21 posts we hold for @pytens. View and reaction counts are the latest single reading for each post, not a live figure, and a recent post is still accumulating both. A view count marked ≈ was rounded by Telegram before we ever saw it — t.me prints views in full below 1,000 and to three significant figures above, so ≈1,200,000 means somewhere between 1,150,000 and 1,249,999. Unmarked counts are exact. Text is reproduced from the public post preview and truncated for length.