اوبر بهتازگی مقاله فنی فوقالعادهای درباره معماری «کارخانه نرمافزار» (Software Factory) خود منتشر کرده که خواندنش برای هر تیم مهندسی فعال در حوزه ایجنتها واجبه.
در اوبر بیش از ۷۰ درصد Pull Requestها توسط ایجنتها تولید یا ویرایش میشوند و روزانه بیش از ۳۰ هزار اجرای مهارت (skill) دارند. نکته شگفتانگیز اینه که با وجود رشد ۷ برابری کاربران و ۹٫۴ برابری درخواستها، هزینه کل AI آنها ثابت مانده و هزینه هر تسک تا ۵۲ درصد کاهش پیدا کرده است.
چند درس و راهکار کلیدی از معماری بهینهسازی اوبر:
🔹 حذف سربار اسکیماهای MCP با رویکرد CLI و جستجوی ابزار:
بارگذاری مستقیم دهها سرور MCP باعث میشد مدل قبل از دریافت اولین پرامپت، ۵۰ تا ۷۰ هزار توکن اسکیما را در هر دور با خودش حمل کند. اوبر تمام سرورهای MCP را پشت یک گیتوی برد و آنها را بهشکل دستورات CLI یا جستجوی درجا درآورد تا فقط اسکیماهای لازم وارد کانتکست شوند.
🔹 اجرای ابزارها با رویکرد Code-Mode بهجای فراخوانی مستقیم چتی:
بهجای اینکه مدل برای اجرای کوئری و چند بار بررسی وضعیت (polling) در هر مرحله توکن مصرف کند، این فرآیندها در قالب اسکریپتهای پایتونی در یک سابپراسس اجرا میشوند و فقط نتیجه نهایی به مدل برمیگردد. همین تغییر ساده مصرف توکن را بین ۵۰ تا ۹۹ درصد کاهش داده است.
🔹 گراف کانتکست با ۲۴ میلیون نود:
ایجنتها بهجای جستجوی کورکورانه در صدها مخزن کد، مستقیماً از یک گراف دانشی شامل سرویسها، لاگها، معماری و PRهای قبلی اطلاعات میگیرند. این کار زمان حل تسک را از ۲۰ دقیقه سرگردانی به ۳۸ ثانیه کاهش داده است.
🔹 روتینگ مدلها بر اساس بنچمارک واقعی (Pareto):
اوبر سابایجنتهای کمکی را بهطور پیشفرض به مدلهای ارزانتر و سریعتر میسپارد و مدلهای پیشرفتهتر (Frontier) را فقط برای برنامهریزی اصلی نگه میدارد.
🔹 مدیریت کش کانتکست و زمان بیکاری:
افزایش TTL کش به یک ساعت برای سشنهای تعاملی برنامهنویسان (بهدلیل وقفههای کاری) و ۵ دقیقه برای سابایجنتهای موقت، از هدررفت بازسازی مداوم کانتکست جلوگیری کرده است.
مطالعه متن کامل بلاگپست اوبر:
https://www.uber.com/us/en/blog/efficient-software-factory/?uclick_id=8c39ed77-46d9-4e1a-bd0a-20aaec118b9a
Post #482
598