免费模型额度看着充裕,但一个超时重试循环就可能悄悄烧光。这个 Python 脚本在调用前做保守预估、调用后记录实际用量,超预算直接拒绝请求,防止意外浪费。
脚本从 JSON 文件读取预算和已用额度,调用前按提示词字节数除以四、加上最大响应 token 数、再留 15% 余量做预估;调用后从响应中读取 usage 字段并原子化写入账本。若端点返回异常或缺少可用 token 计数,脚本会退出且不更新账本。
典型场景:超时重试包装器在首个响应前把慢请求重试四次,token 消耗成倍增长;长上下文缓冲每轮都发送同样的 6k token 历史。仪表盘只显示总量下降,看不出是哪次调用导致。本地账本在请求发出前就拦截超预算调用。
用法:配置环境变量后运行python budgeted_call.py '提示词'。测试时可将 BASE_URL 指向不可达地址,验证脚本非零退出且账本不变。
注意:单 JSON 文件不支持并发共享预算,不适合对延迟有硬性 SLO、需要审计或合规审查的场景。免费端点也不适合发送敏感提示词,仅作金丝雀测试目标。
脚本假设端点遵循 OpenAI 风格 chat completions 路径并返回 usage 字段,不依赖特定模型列表。若免费服务返回的 usage 字段结构不同,脚本会停止而非静默少计。文中 30,000,000 token 额度来自参考材料,实际以当前配额页为准,可通过环境变量调整。
#开发者 #工具 #Python #CLI #Token预算 #API调试 #MonkeyCode
@DevToolboxHub
