黄石无域结构智能技术有限公司

RSR 稳定节流控制器

请求级黑盒原型 · 本机实测 · 接口透明

面向大模型 API 与本地推理的稳定节流机制:识别完全相同的重复请求, 在代理层复用已有回答,减少发往模型的调用与词元(token)消耗,同时保持输出质量。 已在真实 DeepSeek API 与本机 LM Studio 环境完成调用测试, 效果由独立于被测代理的计量层记录、团队交叉复算。

欢迎合作验证 · 场景适配 · 学术交流

10→6
真实模型调用
(10 项请求中 4 次复用命中)
4 项
复用命中
(cache_header=HIT)
40.5%
模型侧 token 减少
(仅本轮任务集)
10/10
三段任务质量校验
(含复用返回)
请求 完全相同? 复用已有回答 复用返回 发往模型 ✓ 质量校验 10/10 ✓ 独立计量层记录

验证记录 · R13 本机实测

请求级黑盒原型 · 独立计量层记录 · 冻结脚本可复算(run_id 20260926T000553Z)

分段请求数发往模型复用命中质量校验说明
A1 对照1010010/10跑前基线,全部调用模型
B 原型组1064(HIT)10/10重复请求复用回答
A2 对照1010010/10跑后基线,核对模型漂移

本轮预置精确重复请求的 10 项任务:A1/A2 各有 10 次真实模型调用,B 组 6 次真实调用、 4 次复用已有回答(cache_header=HIT);三段任务质量各 10/10。 模型侧 token:A1/A2 各 296,B 176,约少 40.5%(缓存回放 usage 不重复计入)。 四次缓存命中耗时约 1–4ms,属单轮小样本,不作一般延迟对比。 以上数字仅适用于本轮任务集,不是通用省钱比例或省电宣称。 实验使用冻结脚本与独立计量层日志记录;原始记录已留存,可在约定范围内复核。 效果由独立于被测代理的计量层记录、团队交叉复算,不属于外部认证;HARD_PASS 为本轮预设验收门通过。

机制

三层互补中的「请求级」一层

请求级复用(RSR)

在代理层识别完全相同的重复请求并复用回答,不再把相同请求发往模型。通过兼容接口接入,具体以目标系统验证为准。

节流控制

迭代自内部研究体系:稳定优先,节流不牺牲质量,边界可控、可脱。

独立计量层

所有调用经独立计量层记录(attempt / success / latency / usage),效果可审计、可复算。

边界与理论收益

原则明确,具体效果以目标系统验证为准

无侵入 · 无修改 · 无残留

通过兼容接口接入;"不改业务代码""运行后无残留"以本次目标系统验证范围为准,其他环境需重新实测。

多种工况适配(理论设计)

面向无人机、机械臂等嵌入式控制与高并发推理场景设计,属理论设计方向;目前暂无相关研究条件,适配范围与效果以目标系统实际验证为准。

理论省电 / 省开销

理论省电/省开销=请求·token 减少+模型降温/降负载收益。未接独立电表,不作实测功耗百分比宣称。

合作验证 · 场景适配 · 学术交流

我们已完成可复算的本机验证,欢迎就真实工况开展合作验证、场景适配与学术交流;具体范围以双方确认的接口与验收条件为准

API 用量审计咨询

协助梳理一段时间的大模型 API 调用记录,定位完全相同的重复请求与潜在冗余,量化可节省额度(以真实记录为准)。

本地模型适配咨询

本地大模型(LM Studio 等)安装、接口对接与运行调优咨询,适合对数据隐私或成本敏感的小团队。

稳定节流接入验证

在 API 与模型之间做 RSR 试点验证:通过兼容接口对接;"不改业务代码""随时可拔除"以目标系统验证范围为准。