ShareAPI QualityShareAPI 自测

METHODOLOGY / V1.0

测量交付表现,不制造“智商认证”。

方法版本 shareapi-delivery-v1 · 2026-09-08

本站由 ShareAPI 自行运营,不是独立第三方认证机构。分数来自真实 API 请求,没有演示数据。通过测试不保证模型身份,也不保证每一次用户请求的质量。

01 / 我们测什么

完整测试包含 20 个样本,五个类别各 4 个;轻量抽测每类 1 个。测试内容为自建、带确定答案的合成任务,不冒用任何外部榜单分数。

题目每轮换用新的数值和记录,题库版本及请求配置指纹随结果保存。温度、输出上限、推理强度及协议设置的变化会形成新的比较组。协议不支持的能力不会伪装成通过。

02 / 分数怎么计算

测试集通过率 = 客观评分通过样本数 ÷ 全部尝试样本数。能力分数按同配置最近三轮完整测试汇总;历史图每点表示一次完整测试。轻量抽测仅用于接口可用性,不与较难的完整题集混算能力分数。请求完成率与 P95 耗时按最近三轮全部调用汇总。失败请求保留在分母中。请求完成率另行展示,不将 HTTP 200 直接等同于答案正确。

接口错误、超时、流式中断、输出预算耗尽与答案不正确分开记录。耗时 P95 是已完成请求的端到端时长,不是首 Token 延迟。公开的 Wilson 95% 区间仅是样本比例的不确定性参考;同类题目可能相关,不能解释为对全部任务或模型真实性的保证。

03 / 基线与异常

默认不凭第一轮分数宣布“正常”。至少积累三轮完整测试且无传输失败后,由维护者核验并冻结历史基线。它只代表本站在指定版本和配置下的历史表现,不是独立原厂参考。基线不会随新结果自动下降。

连续两轮完整测试比历史基线下降至少 10 个百分点,会显示“能力下降 · 待复核”。完整测试汇总通过率低于 80% 时,即使尚无基线,也会显示“通过率偏低 · 待复核”,且不允许把这个低分冻结为正常基线。这些都是工程预警阈值,不是统计显著性结论,也不是“上游造假”的指控。请求完成率低于 90% 显示服务异常;超过 14 小时无新抽测,或超过 36 小时无完整评测,显示结果过期。未确认基线时显示基线采集中。

同名模型可能存在不同部署、参数、账号池或版本;响应中的模型字段仅是上游声明。兼容别名必须明确标注,不能用另一款模型的成绩证明原厂模型质量。第一版不会自动切换或停用生产线路。

04 / 运行与隐私

国内、海外分别从当地节点发起探针,结果异步汇总。普通用户推理不等待评测。每 6 小时轻量抽测,UTC 00:00 时段完整测试;设置每日调用数、输入与输出 Token 预留上限,额度不足时停止新调用。监测暂停后结果会按时间自动标为过期。

只使用合成测试内容,不采集客户对话。测试 Key、原始输出、完整题目、签名密钥均不进入公开接口。公开页面只提供聚合指标、样本结果、版本指纹与响应声明。探针失败不自动提交私密内容到外部评测平台。

05 / 参考方法