samkhya v1.0 是首个为嵌入式SQL查询优化器提供LLM可插拔校正后端的库。支持将Anthropic Claude、OpenAI GPT-4o-mini或本地Ollama接入DataFusion、DuckDB、Polars等引擎的基数估计环节,通过4行HTTP合约完成集成。内置Python FastAPI和Node TypeScript参考服务器,同时提供可证明的安全上限(LpJoinBound),确保幻觉输出不会导致劣于原生计划的查询计划。
该库在星型5连接族上实现40.95倍于AGM的紧致提升(所有30个测试单元格占优),LLM传输层P95延迟0.07–0.11毫秒。在JOB-Slow基准上与原生DataFusion 46对比,几何平均耗时1.038倍(17胜/38平/0负),预注册的≥1.35倍目标被证伪。作者在发布中明确报告了证伪的预注册假设,旨在修复该领域的可信度赤字。
工程实现为一个13-crate的Rust工作区,包含约266个测试块、17个属性测试、约3100万次模糊测试执行无崩溃。提供5层可替换架构:可移植统计草图、反馈记录器、LpJoinBound安全夹、GPU批量推理(可选)、可插拔校正器后端。默认后端为梯度提升树,TabPFN-2.5和LLM-via-HTTP为可选特性。支持DataFusion(生产)、DuckDB(生产)、Polars(Beta)、Iceberg(生产)等引擎。Apache-2.0单协议许可,含§3专利授权。
GitHub
#开发者 #工具 #samkhya #Rust #DataFusion #DuckDB #Polars #LLM #基数估计 #开源
📢 频道:@DevToolboxHub
