اینجا سعی میکنم که چیزایی رو به اشتراک بزارم که ممکنه ai نتونه دقیق یا حداقل سریع پیدا کنه، یه خورده عمیقتر و غیر تکراری
a technocrat of handwritten culture
@Timematters3@FarokhNotes یه چیز جالبی که داره اینه مدل فرمولای ریاضی رو حفظه ولی برای حل کردن از یه جایی که پیچدگی بیشتره یاد گرفته بره از ابزار استفاده کنه (مثل ماشین حساب یا python runtime ..)
و این شکلی هم سریعتر و هم مطمئنتر می تونه به جواب یه مسئله برسه
در مورد شکل پاسخدهی درست می فرمایید ولی واقعیت اینه که اساس ادراکی مدلها روی ریاضیاته
از وزنها و اکتیویشن فانکشنا بگیر تا خود وکتور اسپ��س ها که فضای ریاضیاتیه و وقتی بحث تغییر یا بهتر شدن توی یه حوزه ای میاد، مخصوصا اونجاهایی که RL base هستش و مدل خودش میاد خودشو بهتر میکنه، هندل کردن ریاضیات(مثلا اونجایی که بیاد درکش رو از یک مفهوم ریاضیاتی به مختصاتی در فضای ادراکیش نسبت بده) در قیاس با مفاهیم و معانی انسانی بهتر عمل می کنن .
اما در مورد شکل پاسخ دهیشون، که بله خیلی جا ها با اجرای کد جواب مسائل ریاضی رو پیدا می کنند
که از اساس برخورد با ریاضیات با کد و کامپیوتیشن دقیقتر و سریعتر و در نهایت منطقی تره تا اینکه بخواد با مثلا اتنشن مکانیزم به جواب برسه.
معمولا ای��است :
1-بحث حریم شخصی ( اینکه یه دیتایی داری نمی خوای لیک شه ، یه کار حساسی داری که نمی خوای بقیه هم بدوننش )
2-می تونی جوری که می خوای تغییرش بدی ( از یه کاربرد خاص بگیر تا برداشتن محدودیت هاش )
3-در مواقعی هزنیه تمام شده پایین تر
بازی که اوپن کلاو شروعش کرد و تقدیم هرمس نازنین شد
وقتی بتونی در حالی که به چارت/نمودار نگاه میکنی، بتونی ترندها رو هم داخلشون تحلیل کنی، دید جالبی بهت میدن
به این خیزشه وسط تصویر نگاه کنین
اگر در جریان خبرها بودین احتمالا می تونین حدث بزنین که اون زرده که اضافه شده مربوط به اوپن کلاوه
اساسا اوپن کلا اومد بازی رو از نو تعریف کرد، قبلش اصلا استفاده از ایجنت شخصی اینقدر جذابیت نداشت
گنگ بود و خیلیا اون جوری که باید درک استفاده از LLMها رو نداشتن
و اوپن کلاو تونست یه جورایی هیجان و جذایبت رو خیلی بیشتر کنه
اما چطوری ؟
خیلی ممنون شما چطوری ؟
رازش توی 2 نکته خلاصه میشه :
1- فایل mdهای زیباش بود که بعد کم کم ایجنت های دیگه هم اومدن ایده شو گرفتن و بسطش دادن
(که حافظه ، مهارت و نکاتی که باید رعایت میکرد رو خیلی شیک و حتی روزانه برا خودش می نوشت )
2-جسارت و جرئت و اختیار کامل دادن به مدل llm
( از واتساپ شخصی بگیر تا تقویم و برنامه ریزی تا ایمیل اصلا تقریبا چیزی نبود که دسترسیشو نداشته باشه ، به معنی واقعی کلمه وحشی بود )
اما چی شد ؟
چطور یکی دیگه اومد کم کم جاشو، تقریبا کامل گرفت ؟
ترکیبی از ایناست 1-کدینگ ایجنت محتوای tool ، skill، شخصی سازی ها و پروفایلش و حافظه و پیام هات رو تقریبا هر سری برای مدل میفرسته
2-لوپ ، حالا tool calling loop ، یه جایی به هدف نرسیدنش و موندنش توی لوپ که باعث ارسال دفعات مجدد میشه
2-خود reasoning دیپ سیک خیلی تاثیر داره ، مثلا فکر میکنه راجب یه چیزی بعد تصمیم میگره و اون همچنان توی حافظه هی دوباره توی درخواست و تصمیم های بعدیش براش فرستاده میشه
اصلا صرفه نداره !
حتی با کونتایز 3 بیتی unsloth هم باز 100 گیگ لازم داری ، که قیمتی که با api ارائه میشه در مقایسه با قیمت تمام شده استفاده از سخت افزار شخصی هیچ توجیهی نداره .
*مگر بخوای برای یه استفاده خاصی باشه که پرایوسی برات مهمه در اون صورت هم باید سعی کنی از دیستلیشین مدل توی حوزه ای که می خوای استفاده کنی .
چند وقته به شدت مجذوب هرمس شدم
تعجبی هم نداره که برای من اینشکلی باشه؛ شما وضعیت رو نگاه کنین
در حال حاضر هرمس رتبه اول رو داره در:
- بهرهوری
- اینجت کدینگ
- ایجنت شخصی
و مصرفش هم جالبه امروز توی اوپن روتر یک تریلیون توکن از طرف کاربرایی که ازش استفاده میکردن مصرف شده!
(بدیهیم هست خود من امروز بیشتر از 30 میلیون رو باهاش سوزوندم)
درمورد مدل های llm که بیشتر ازشون در هرمس استفاده شده، deepseek v4 flash رتبه اول رو در مقدار توکن مصرفی با هرمس داره.
چرایی اینکه دیپ سیک اوله اگه از رو بنچ مارک artificial analysis نگاه کنی، مدل DeepSeek V4 Flash 0731 که همین دو روز پیش منتشرش کردن(9 مرداد) رتبه اول رو پیدا کرده در نسبت هزینه به هوش .
در آخر یه چیز جالبی که پیدا کردم در مورد این مدل Flash 0731 و جالب توجه بود؛ این مدل با این بنچ مارک��ا، کلا 284 میلیارد پارامتر داره که فقط 13میلیارد پارامترش فعاله !!!
*این آخری رو ندیدم خیلی راجبش حرف زده باشند، ولی فکرشو که میکنی این عددها در نوع خودش بی نظیرند.
خاطرتون باشه ماجرای md فایل بغل پرامپت ورودی دادن از دغدغه hallucination و مسئله بالا ��ردن قطعیت و در نهایت نزدیکتر کردن مدل LLM به دنیای واقعی بود ، که قابل اتکاتر بشن .
حالا SKILL دو جنبه داره یکی مقیاس پذیری دانش و دومی کاهش هلوسینیشن .
برای hook هم مسئله اطمینان و کنترل رفتاره .
و از اونجایی که این LLMها مثل یک غول گشنه هی از هرچی ورودی میاد یاد میگیرن در نتیجه بدیهی میشه که؛ مهارتها رو یاد میگیرن یا لازمه کمتر براشون توضیح داد و رفتار خودشون رو هم بهتر یاد میگیرن چطور کنترل کنند .
بوریس میگه که هر ۶ ماه یک بار claude.md و skillها و hookها رو حذف کنین، ببینین خود مدل (بدون این دستورات) چطوری عمل میکنه و ممکنه شگفتزده بشین. به صورت مشخص برای Opus 5 اینو پیشنهاد میکنه.
بالاخره تیک آبیمو گرفتم!
بعد یه سال توییت کردن و به صورت مطلق بن شدن از طرف الگوریتم ایکس برای هر پستی که میذاشتم، به این نتیجه رسیدم که با ادامه کاری که می کردم نمیشد وارد اکسپلور ایکس شد.
که تبعا هیچ انگیزه ای برای نوشتن چیزایی که احتمال میدم برای بقیه هم ممکنه مفید باشند نداشتم.
گرچه خیلی از اکانتهای تیک آبی دار هم دیدم که محتواشون دچار کم لطفی الگوریتم واقع میشه، در هرصورت اگر این باگ هم حل نشه، حداقلش اینه که محدودیت مسخره طول متن دیگه نیست و راحت تر میشه چیزی که باید رو گفت.
و در آخر چیزی که ندیدم بهش اشاره کرده باشند؛ اینه که با آی پی هلند هم پرداخت با کریپتو ممکن هستش و با usdc بر بستر base با تراست والت خیلی راحت انجام شد .