METHODOLOGY / V1.0
测量交付表现,不制造“智商认证”。
方法版本 shareapi-delivery-v1 · 2026-09-08
本站由 ShareAPI 自行运营,不是独立第三方认证机构。分数来自真实 API 请求,没有演示数据。通过测试不保证模型身份,也不保证每一次用户请求的质量。
01 / 我们测什么
完整测试包含 20 个样本,五个类别各 4 个;轻量抽测每类 1 个。测试内容为自建、带确定答案的合成任务,不冒用任何外部榜单分数。
- 逻辑推理:数量约束、0/1 背包优化、有向图最短路及路径计数、带约束排列计数。
- 代码理解:推导 Python 列表处理、可变对象引用、闭包绑定及循环状态结果。不执行模型生成的代码,不等同于完整编程 Agent 评估。
- 指令遵循:筛选、排序、大小写与严格 JSON 输出;不允许额外字段。
- 上下文检索:在不同长度、不同位置的合成记录中提取有效信息,排除作废信息。不是对标称最大上下文的认证。
- 工具调用:真实 API tool/function calling,检查工具名称、参数类型和值。不把文字描述当作工具调用,也不等同于多轮 Agent 成功率。
题目每轮换用新的数值和记录,题库版本及请求配置指纹随结果保存。温度、输出上限、推理强度及协议设置的变化会形成新的比较组。协议不支持的能力不会伪装成通过。
02 / 分数怎么计算
测试集通过率 = 客观评分通过样本数 ÷ 全部尝试样本数。能力分数按同配置最近三轮完整测试汇总;历史图每点表示一次完整测试。轻量抽测仅用于接口可用性,不与较难的完整题集混算能力分数。请求完成率与 P95 耗时按最近三轮全部调用汇总。失败请求保留在分母中。请求完成率另行展示,不将 HTTP 200 直接等同于答案正确。
接口错误、超时、流式中断、输出预算耗尽与答案不正确分开记录。耗时 P95 是已完成请求的端到端时长,不是首 Token 延迟。公开的 Wilson 95% 区间仅是样本比例的不确定性参考;同类题目可能相关,不能解释为对全部任务或模型真实性的保证。
03 / 基线与异常
默认不凭第一轮分数宣布“正常”。至少积累三轮完整测试且无传输失败后,由维护者核验并冻结历史基线。它只代表本站在指定版本和配置下的历史表现,不是独立原厂参考。基线不会随新结果自动下降。
连续两轮完整测试比历史基线下降至少 10 个百分点,会显示“能力下降 · 待复核”。完整测试汇总通过率低于 80% 时,即使尚无基线,也会显示“通过率偏低 · 待复核”,且不允许把这个低分冻结为正常基线。这些都是工程预警阈值,不是统计显著性结论,也不是“上游造假”的指控。请求完成率低于 90% 显示服务异常;超过 14 小时无新抽测,或超过 36 小时无完整评测,显示结果过期。未确认基线时显示基线采集中。
同名模型可能存在不同部署、参数、账号池或版本;响应中的模型字段仅是上游声明。兼容别名必须明确标注,不能用另一款模型的成绩证明原厂模型质量。第一版不会自动切换或停用生产线路。
04 / 运行与隐私
国内、海外分别从当地节点发起探针,结果异步汇总。普通用户推理不等待评测。每 6 小时轻量抽测,UTC 00:00 时段完整测试;设置每日调用数、输入与输出 Token 预留上限,额度不足时停止新调用。监测暂停后结果会按时间自动标为过期。
只使用合成测试内容,不采集客户对话。测试 Key、原始输出、完整题目、签名密钥均不进入公开接口。公开页面只提供聚合指标、样本结果、版本指纹与响应声明。探针失败不自动提交私密内容到外部评测平台。
05 / 参考方法
- Artificial Analysis Endpoint Accuracy Index:同模型不同服务端点的能力对照与证据边界。
- AI Ping:地域探测与服务性能指标。
- RULER、BFCL:长上下文和工具调用评测的后续扩展方向。当前分数不是这些标准题库的复现成绩。