جدا از موج Decision Modelها، چند خبر فنی این هفته هست که برای AI Engineerها واقعاً ارزش دنبالکردن داره.
اولیش EmbeddingGemma 2 از Google DeepMindـه؛ یه مدل باز 740M پارامتری که متن، کد، تصویر، صدا و ویدیو رو داخل یه فضای Embedding مشترک میبره. مدل Apache 2.0ـه، برای اجرای روی لپتاپ و موبایل طراحی شده و حتی میشه فقط بخشهای موردنیازش رو بارگذاری کرد؛ مثلاً نسخه متن و کد سبکتر از مدل کامل چندرسانهایه. برای جستوجوی محلی، RAG، جستوجوی کد و بازیابی بین چند نوع محتوا، این خیلی کاربردیتر از فرستادن همهچیز به یه API بزرگه.
https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2
خبر دوم شاید از نظر مهندسی حتی مهمتر باشه. Hugging Face یه راهنمای کامل برای Multi-Harness RL منتشر کرده و یه نتیجه خیلی معنیدار داره: همون مدل LFM2.5-2.6B با دقیقاً همون وزنها در Mini-SWE-Agent حدود ۶۲٪ و در Claude Code فقط ۳۳٪ از کارها رو حل کرده. یعنی عملکرد Agent فقط «قدرت مدل» نیست؛ برنامهای که دور مدل ساخته شده، Toolها، Context، حلقه اجرا و نحوه پایاندادن کار میتونن نتیجه رو تقریباً دو برابر تغییر بدن.
https://adithyask-multi-harness-rl.hf.space
جالبتر اینکه وقتی همون مدل با RL روی چند Harness مختلف آموزش داده شد، عملکرد کلیش از ۴۲٪ به ۵۴٪ رسید. این یه نکته مهم برای Benchmarkها هم داره: وقتی میگیم «فلان مدل روی Coding Agent بهتره»، بدون گفتن Harness عملاً نصف اطلاعات رو حذف کردیم.
یه موضوع کوچیکتر ولی کاربردی هم از پست Andrej Karpathy راه افتاده: استفاده از ASD-STE100 برای توضیحهای LLM. این همون انگلیسی کنترلشدهایه که برای مستندات فنی صنایع هوایی ساخته شده؛ جمله کوتاه، فعل مستقیم، واژه ساده و ابهام کمتر. الان چند Skill برای Claude Code و Agentهای دیگه ساخته شده که خروجی توضیحی رو با همین قواعد بازنویسی میکنن تا از متنهای شلخته و پر از حاشیه کم بشه.
https://github.com/JordanBelfort1/explaining-in-asd-ste100
و یه نمونه جالب دیگه از قدرت مدلهای تخصصی BioCLIP 2ـه. این مدل برای تصاویر موجودات زنده روی TreeOfLife-200M آموزش دیده و روی تشخیص گونهها و چند کار تصویری زیستی از مدلهای عمومی جلو زده. نکته مهمش برای من خود زیستشناسی نیست؛ دوباره همون الگوییه که داریم همهجا میبینیم: یه مدل نسبتاً تخصصی، وقتی دقیقاً برای یک فضای مسئله ساخته شده، لازم نیست اندازه یه Frontier LLM باشه تا روی همون کار خیلی قوی عمل کنه.
https://huggingface.co/imageomics/bioclip-2
خلاصه اینکه جهت کلی معماری AI داره جالب میشه: بهجای اینکه همهچیز رو بندازیم گردن یه LLM غولپیکر، داریم قطعات تخصصی میسازیم؛ Embedding Model برای بازیابی، Decision Model برای تصمیم، مدل تخصصی برای دامنه مشخص، و یه Agent Harness خوب برای وصلکردن همه اینها به هم.
شاید سؤال مهم دیگه «بهترین مدل چیه؟» نباشه؛ «بهترین ترکیب مدلها برای این مسئله چیه؟» سؤال بهتریه.
🛠 Join @LLMEngineers Community
Post #528
664
- 👍 7
- ❤ 6