اکثر پیادهسازیهای Text-to-SQL وقتی به پروداکشن میرسند شکست میخورند.
دادن اسکیمای دیتابیس به LLM در دموها جذاب است، اما در سیستمهای واقعی با سه مشکل مواجه میشود:
• محاسبه اشتباه متریکهای بیزینسی
• کوئری زدن روی جدولهای قدیمی و منسوخشده
• تعاریف مبهم و ایجاد گزارشهای نادرست
در جدیدترین مقالهام، دلایل شکست روشهای ساده و نحوه ساخت یک Agentic Data Stack حاکمیتیافته در سه لایه را بررسی کردهام:
۱. لایهی Semantic: ایجنتها به جای دیتابیس خام باید با لایههای سمانتیک (مثل dbt و Cube) کار کنند.
۲. پایش فعال و CI: استفاده از Data Contractها برای جلوگیری از ناهماهنگی اسکیما.
۳. اسکیل های ماجولار/modular skills ایجنت: ساختار چندمرحلهای برای جستجوی متادیتا، فراخوانی API و اعتبارسنجی خروجی.
🔗 https://mlnotes.substack.com/p/beyond-text-to-sql-building-a-governed
😎 Mehdi Allahyari
Post #4764
4.18K