TGViewer
نوشته‌های ترمینالی نوشته‌های ترمینالی @terminal_stuff · 3.51K subscribers
Post #3153 2.04K
یه سوالی که جواب دادن بهش راحت نیست، اینه که دو تا LLM مختلف چه عملکردی نسبت به هم دارند و کدوم یکی بهتره. از اونجایی که پارامترهای زیادی مثل کیفیت prompt و عدم قطعیت و ... دخیله، شاید خیلی وقتها تجربه ما واقعا درست نباشه. مخصوصا این که اکثرا وقتی یه مسأله حل میشه رهاش میکنیم و دیگه با LLM دیگه‌ای بررسیش نمی‌کنیم.

اگه شما هم مثل من براتون سواله کدوم مدل برای برنامه‌نویسی عملکرد بهتری داره، میتونید از benchmark های مختلف استفاده کنید. یه بنچمارک خوبی که پیدا کردم swe benchmark بود
https://swe-rebench.com/leaderboard

میتونید هم در زمینه متنی هم در زمینه tool calling مقایسه کنید. توضیح داده که بر چه اساسی ارزیابی می‌کنه و من دیگه وارد جزییات نمیشم.

در زمینه نتایج هم چیزی که برام جالب بود مدل qwen3 coder بود که اگرچه اسمش رو نشنیده بودم زیاد و قیمت APIش هم به نسبت پایین بود، عملکرد خوبی داشت. خودم هم تستش کردم و عملکرد و سرعت خوبی داشت.
  • 🔥 10
More from @terminal_stuff
  1. Oct 5, 2026💡گواهی ریشه داخلی چیست و چرا نباید برای دسترسی به اینترنت بانک آن را روی دستگاه خود نصب ک…
  2. Sep 23, 2026I am done with this shit Article, Comments
  3. Sep 19, 2026اگه حوصله دارید ببینید به نظرم ایده های جالبی مطرح کرده.
  4. Sep 19, 2026اینو یادم رفته بود اینجا بذارم. یه گپ است در مورد هوش مصنوعی و اینکه چه فرصت هایی رو برای…
  5. Sep 17, 2026از زبون آمار: آیا AI کدهای خوبی می‌نویسه یا نه؟ وقتی تولید کد تقریباً مجانی و خیلی سریع ان…
  6. Sep 17, 2026photo post
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →