面向大模型 API 与本地推理的稳定节流机制:识别完全相同的重复请求, 在代理层复用已有回答,减少发往模型的调用与词元(token)消耗,同时保持输出质量。 已在真实 DeepSeek API 与本机 LM Studio 环境完成调用测试, 效果由独立于被测代理的计量层记录、团队交叉复算。
欢迎合作验证 · 场景适配 · 学术交流
请求级黑盒原型 · 独立计量层记录 · 冻结脚本可复算(run_id 20260926T000553Z)
| 分段 | 请求数 | 发往模型 | 复用命中 | 质量校验 | 说明 |
|---|---|---|---|---|---|
| A1 对照 | 10 | 10 | 0 | 10/10 | 跑前基线,全部调用模型 |
| B 原型组 | 10 | 6 | 4(HIT) | 10/10 | 重复请求复用回答 |
| A2 对照 | 10 | 10 | 0 | 10/10 | 跑后基线,核对模型漂移 |
本轮预置精确重复请求的 10 项任务:A1/A2 各有 10 次真实模型调用,B 组 6 次真实调用、 4 次复用已有回答(cache_header=HIT);三段任务质量各 10/10。 模型侧 token:A1/A2 各 296,B 176,约少 40.5%(缓存回放 usage 不重复计入)。 四次缓存命中耗时约 1–4ms,属单轮小样本,不作一般延迟对比。 以上数字仅适用于本轮任务集,不是通用省钱比例或省电宣称。 实验使用冻结脚本与独立计量层日志记录;原始记录已留存,可在约定范围内复核。 效果由独立于被测代理的计量层记录、团队交叉复算,不属于外部认证;HARD_PASS 为本轮预设验收门通过。
三层互补中的「请求级」一层
在代理层识别完全相同的重复请求并复用回答,不再把相同请求发往模型。通过兼容接口接入,具体以目标系统验证为准。
迭代自内部研究体系:稳定优先,节流不牺牲质量,边界可控、可脱。
所有调用经独立计量层记录(attempt / success / latency / usage),效果可审计、可复算。
原则明确,具体效果以目标系统验证为准
通过兼容接口接入;"不改业务代码""运行后无残留"以本次目标系统验证范围为准,其他环境需重新实测。
面向无人机、机械臂等嵌入式控制与高并发推理场景设计,属理论设计方向;目前暂无相关研究条件,适配范围与效果以目标系统实际验证为准。
理论省电/省开销=请求·token 减少+模型降温/降负载收益。未接独立电表,不作实测功耗百分比宣称。
我们已完成可复算的本机验证,欢迎就真实工况开展合作验证、场景适配与学术交流;具体范围以双方确认的接口与验收条件为准
协助梳理一段时间的大模型 API 调用记录,定位完全相同的重复请求与潜在冗余,量化可节省额度(以真实记录为准)。
本地大模型(LM Studio 等)安装、接口对接与运行调优咨询,适合对数据隐私或成本敏感的小团队。
在 API 与模型之间做 RSR 试点验证:通过兼容接口对接;"不改业务代码""随时可拔除"以目标系统验证范围为准。