LLM结构化输出基准:三家API差距显著
一项针对 OpenAI、Anthropic、Gemini 六款模型的基准测试发现,“结构化输出”功能在实际生产中远非可靠契约。测试涉及 8 个异构 JSON Schema 和两种独立验证器(ajv、hyperjump)。
- Anthropic 接受所有 Schema,但对 7 层嵌套对象(S3)会静默返回错误形状:对象字段被序列化为字符串,HTTP 200 且无错误提示。
- OpenAI 的 strict: true 模式拒绝大部分标准 Schema(8 个中仅通过 2 个),但通过后严格遵循。
- Gemini 处于中间:拒绝 oneOf、type-arrays 等特性,但接受的 Schema 能严格遵循,且成功处理了 Anthropic 失败的 7 层嵌套。
建议在管道中加入独立校验,对 Anthropic 扁平化 Schema,OpenAI 使用 additionalProperties: false,Gemini 避免 oneOf。
原文链接
#开发者 #工具
📢 频道:@DevToolboxHub
Post #805
2

