雪糕API

api.xn--o8z274c.top · 测评于 2026-10-04 02:08 · 最近更新批次 #749

49.1
综合评分
40.8
能力分(40%)
52.4
性能分(40%)
58.9
一致性分(20%)
0.56s
首字最快用时
6.33s
首字平均用时
12,288.9
每秒最大 tokens
636.6
平均每秒 tokens
13
测评模型数
gpt-6-astra
最佳模型 82.2
关于统一测评 本页数据来自一次「能力 + 性能 + 一致性」统一测评:能力分由五大维度标准化题目判分,性能分由成功率、首字延迟与输出吞吐综合计算,一致性分来自结构化输出、指令遵循、工具调用、流式协议等专项检测。综合分 = 能力 40% + 性能 40% + 一致性 20%。

测评预警

以上为测评预警(题目通过率或某一能力维度低于配置阈值),不等同于安全或诈骗结论。

各模型得分明细

前往该中转站
每个模型展示其最新一次统一测评结果;不同批次测评过的不同模型会共同保留,不会互相覆盖。展开「一致性专项明细」可查看逐项检测结果。
gpt-6-astra
GPT · 平均延迟 15.85秒 · 成功率 90%(9/10 题)
82.2 分
能力分89.1
性能分71.5
一致性分90.0
首字最快用时1.62秒
首字平均用时9.13秒
每秒最大 tokens2,381.58
平均每秒 tokens334.74
平均响应延迟15.85秒
一致性判定:高度符合声明特征
五大能力维度
数学 100.0 (2/2)
逻辑 100.0 (2/2)
代码 100.0 (2/2)
中文 44.4 (1/2)
知识 100.0 (2/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 10.0 / 10.0 分 通过
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
动态结构化输出 JSON 结构化 · 12.0 / 12.0 分 通过
知识与概念边界 知识准确度 · 0.0 / 10.0 分 异常
知识与概念边界:调用失败,未通过测试。请求失败:Operation timed out after 30000 milliseconds with 0 bytes received
结构污染检查 协议完整性 · 8.0 / 8.0 分 通过
长文本定位与记忆 上下文能力 · 12.0 / 12.0 分 通过
工具调用兼容性 高级功能 · 14.0 / 14.0 分 通过
身份自报检查 声明一致性 · 2.0 / 2.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
gpt-5.6-terra
GPT · 平均延迟 16.04秒 · 成功率 90%(9/10 题)
75.6 分
能力分89.4
性能分49.7
一致性分100.0
首字最快用时2.38秒
首字平均用时9.28秒
每秒最大 tokens66.47
平均每秒 tokens44.62
平均响应延迟16.04秒
一致性判定:高度符合声明特征
五大能力维度
数学 100.0 (2/2)
逻辑 100.0 (2/2)
代码 100.0 (2/2)
中文 100.0 (2/2)
知识 50.0 (1/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 10.0 / 10.0 分 通过
知识与概念边界 知识准确度 · 10.0 / 10.0 分 通过
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
动态结构化输出 JSON 结构化 · 12.0 / 12.0 分 通过
长文本定位与记忆 上下文能力 · 12.0 / 12.0 分 通过
结构污染检查 协议完整性 · 8.0 / 8.0 分 通过
身份自报检查 声明一致性 · 2.0 / 2.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
工具调用兼容性 高级功能 · 14.0 / 14.0 分 通过
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
MiniMax-M3
MiniMax · 平均延迟 8.06秒 · 成功率 60%(6/10 题)
72.8 分
能力分57.8
性能分89.1
一致性分70.0
首字最快用时0.71秒
首字平均用时1.09秒
每秒最大 tokens325.18
平均每秒 tokens186.25
平均响应延迟8.06秒
一致性判定:存在明显行为偏差
五大能力维度
数学 50.0 (1/2)
逻辑 100.0 (2/2)
代码 0.0 (0/2)
中文 100.0 (2/2)
知识 50.0 (1/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 10.0 / 10.0 分 通过
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
知识与概念边界 知识准确度 · 0.0 / 10.0 分 未通过
缺少关键词或最终结论不符合:
动态结构化输出 JSON 结构化 · 0.0 / 12.0 分 未通过
JSON 不可解析、字段多余/缺失,或字段值类型不符合。
长文本定位与记忆 上下文能力 · 12.0 / 12.0 分 通过
结构污染检查 协议完整性 · 0.0 / 8.0 分 未通过
JSON 不可解析、字段多余/缺失,或字段值类型不符合。
身份自报检查 声明一致性 · 2.0 / 2.0 分 通过
工具调用兼容性 高级功能 · 14.0 / 14.0 分 通过
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
该模型触发测评预警:题目通过率 60%,低于 75%;最低能力维度 0 分,低于 30 分
claude-sonnet-5
Claude · 平均延迟 12.60秒 · 成功率 50%(5/10 题)
67.0 分
能力分50.0
性能分78.5
一致性分78.0
首字最快用时2.78秒
首字平均用时3.68秒
每秒最大 tokens133.87
平均每秒 tokens82.23
平均响应延迟12.60秒
一致性判定:基本符合声明特征
五大能力维度
数学 100.0 (2/2)
逻辑 50.0 (1/2)
代码 0.0 (0/2)
中文 50.0 (1/2)
知识 50.0 (1/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 10.0 / 10.0 分 通过
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
动态结构化输出 JSON 结构化 · 0.0 / 12.0 分 未通过
JSON 不可解析、字段多余/缺失,或字段值类型不符合。
知识与概念边界 知识准确度 · 10.0 / 10.0 分 通过
结构污染检查 协议完整性 · 0.0 / 8.0 分 未通过
JSON 不可解析、字段多余/缺失,或字段值类型不符合。
长文本定位与记忆 上下文能力 · 12.0 / 12.0 分 通过
工具调用兼容性 高级功能 · 14.0 / 14.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
身份自报检查 声明一致性 · 0.0 / 2.0 分 未通过
最终答案或格式约束不符合预期。
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
该模型触发测评预警:题目通过率 50%,低于 75%;最低能力维度 0 分,低于 30 分
glm-5.3-flashx
GLM / ChatGLM · 平均延迟 9.73秒 · 成功率 40%(4/10 题)
62.7 分
能力分37.2
性能分75.6
一致性分88.0
首字最快用时2.93秒
首字平均用时3.82秒
每秒最大 tokens173.28
平均每秒 tokens135.85
平均响应延迟9.73秒
一致性判定:基本符合声明特征
五大能力维度
数学 50.0 (1/2)
逻辑 100.0 (2/2)
代码 0.0 (0/2)
中文 50.0 (1/2)
知识 0.0 (0/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 10.0 / 10.0 分 通过
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
知识与概念边界 知识准确度 · 0.0 / 10.0 分 未通过
缺少关键词或最终结论不符合:
动态结构化输出 JSON 结构化 · 12.0 / 12.0 分 通过
结构污染检查 协议完整性 · 8.0 / 8.0 分 通过
长文本定位与记忆 上下文能力 · 12.0 / 12.0 分 通过
身份自报检查 声明一致性 · 0.0 / 2.0 分 未通过
最终答案或格式约束不符合预期。
工具调用兼容性 高级功能 · 14.0 / 14.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
该模型触发测评预警:题目通过率 40%,低于 75%;最低能力维度 0 分,低于 30 分
agnes-2.5-flash
Agnes · 平均延迟 3.53秒 · 成功率 50%(5/10 题)
56.9 分
能力分50.0
性能分87.2
一致性分10.0
首字最快用时0.56秒
首字平均用时0.90秒
每秒最大 tokens145.65
平均每秒 tokens119.17
平均响应延迟3.53秒
一致性判定:与声明特征偏差较大
五大能力维度
数学 55.6 (1/2)
逻辑 100.0 (2/2)
代码 0.0 (0/2)
中文 100.0 (2/2)
知识 0.0 (0/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 0.0 / 10.0 分 异常
多约束逻辑推理:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084756443206567dYxInsNp)
知识与概念边界 知识准确度 · 0.0 / 10.0 分 异常
知识与概念边界:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084756923607606PxSsIa9U)
动态结构化输出 JSON 结构化 · 0.0 / 12.0 分 异常
动态结构化输出:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020847578940385087x3EcQ7S)
复杂指令遵循 指令遵循 · 0.0 / 10.0 分 异常
复杂指令遵循:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084757475954856c5roOzkh)
结构污染检查 协议完整性 · 0.0 / 8.0 分 异常
结构污染检查:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020847583072616722FX4v7Wh)
长文本定位与记忆 上下文能力 · 0.0 / 12.0 分 异常
长文本定位与记忆:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084758376750769RJSgHdqo)
工具调用兼容性 高级功能 · 0.0 / 14.0 分 异常
工具调用兼容性:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084758886808681ME5ojH9C)
流式输出检查 协议完整性 · 0.0 / 7.0 分 异常
流式输出检查:调用失败,未通过测试。流式响应中未提取到内容(HTTP 429):您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084759624405032yvbu6P9N)
身份自报检查 声明一致性 · 0.0 / 2.0 分 异常
身份自报检查:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084759704156553MmLbZSHB)
响应协议完整性 协议完整性 · 0.0 / 5.0 分 异常
响应协议完整性:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 2026100208480011706046OTFak6V7)
该模型触发测评预警:题目通过率 50%,低于 75%;最低能力维度 0 分,低于 30 分
qwen3.8-flash
通义千问 / Qwen · 平均延迟 20.59秒 · 成功率 40%(4/10 题)
54.8 分
能力分39.1
性能分53.7
一致性分88.4
首字最快用时3.40秒
首字平均用时3.89秒
每秒最大 tokens123.93
平均每秒 tokens78.72
平均响应延迟20.59秒
一致性判定:基本符合声明特征
五大能力维度
数学 50.0 (1/2)
逻辑 50.0 (1/2)
代码 0.0 (0/2)
中文 50.0 (1/2)
知识 50.0 (1/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 0.0 / 10.0 分 异常
动态多步计算:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
多约束逻辑推理 推理能力 · 10.0 / 10.0 分 通过
知识与概念边界 知识准确度 · 10.0 / 10.0 分 通过
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
动态结构化输出 JSON 结构化 · 12.0 / 12.0 分 通过
结构污染检查 协议完整性 · 8.0 / 8.0 分 通过
长文本定位与记忆 上下文能力 · 12.0 / 12.0 分 通过
工具调用兼容性 高级功能 · 0.0 / 14.0 分 不适用
工具调用兼容性:接口未支持该可选能力,未计入总分。
身份自报检查 声明一致性 · 2.0 / 2.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
该模型触发测评预警:题目通过率 40%,低于 75%;最低能力维度 0 分,低于 30 分
glm-5.3
GLM / ChatGLM · 平均延迟 12.07秒 · 成功率 30%(3/10 题)
51.1 分
能力分30.4
性能分52.4
一致性分90.0
首字最快用时5.86秒
首字平均用时10.45秒
每秒最大 tokens12,288.89
平均每秒 tokens4,918.06
平均响应延迟12.07秒
一致性判定:高度符合声明特征
五大能力维度
数学 50.0 (1/2)
逻辑 55.6 (1/2)
代码 0.0 (0/2)
中文 0.0 (0/2)
知识 50.0 (1/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 10.0 / 10.0 分 通过
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
动态结构化输出 JSON 结构化 · 12.0 / 12.0 分 通过
结构污染检查 协议完整性 · 8.0 / 8.0 分 通过
长文本定位与记忆 上下文能力 · 12.0 / 12.0 分 通过
身份自报检查 声明一致性 · 2.0 / 2.0 分 通过
知识与概念边界 知识准确度 · 0.0 / 10.0 分 异常
知识与概念边界:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
工具调用兼容性 高级功能 · 14.0 / 14.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
该模型触发测评预警:题目通过率 30%,低于 75%;最低能力维度 0 分,低于 30 分
glm-5.3-flash
GLM / ChatGLM · 平均延迟 26.96秒 · 成功率 30%(3/10 题)
35.2 分
能力分30.4
性能分14.5
一致性分86.0
首字最快用时4.84秒
首字平均用时10.88秒
每秒最大 tokens43.03
平均每秒 tokens38.53
平均响应延迟26.96秒
一致性判定:基本符合声明特征
五大能力维度
数学 0.0 (0/2)
逻辑 100.0 (2/2)
代码 0.0 (0/2)
中文 55.6 (1/2)
知识 0.0 (0/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 10.0 / 10.0 分 通过
知识与概念边界 知识准确度 · 10.0 / 10.0 分 通过
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
动态结构化输出 JSON 结构化 · 12.0 / 12.0 分 通过
结构污染检查 协议完整性 · 8.0 / 8.0 分 通过
长文本定位与记忆 上下文能力 · 12.0 / 12.0 分 通过
工具调用兼容性 高级功能 · 0.0 / 14.0 分 未通过
接口返回成功,但模型未按要求发起有效工具调用。
身份自报检查 声明一致性 · 2.0 / 2.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
该模型触发测评预警:题目通过率 30%,低于 75%;最低能力维度 0 分,低于 30 分
kimi-k3
Kimi / Moonshot · 平均延迟 26.60秒 · 成功率 30%(3/10 题)
32.0 分
能力分28.3
性能分21.8
一致性分60.0
首字最快用时5.55秒
首字平均用时9.48秒
每秒最大 tokens50.40
平均每秒 tokens42.66
平均响应延迟26.60秒
一致性判定:存在明显行为偏差
五大能力维度
数学 100.0 (2/2)
逻辑 44.4 (1/2)
代码 0.0 (0/2)
中文 0.0 (0/2)
知识 0.0 (0/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 10.0 / 10.0 分 通过
多约束逻辑推理 推理能力 · 0.0 / 10.0 分 异常
多约束逻辑推理:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
复杂指令遵循 指令遵循 · 10.0 / 10.0 分 通过
知识与概念边界 知识准确度 · 0.0 / 10.0 分 异常
知识与概念边界:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
动态结构化输出 JSON 结构化 · 12.0 / 12.0 分 通过
结构污染检查 协议完整性 · 0.0 / 8.0 分 异常
结构污染检查:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
长文本定位与记忆 上下文能力 · 0.0 / 12.0 分 异常
长文本定位与记忆:调用失败,未通过测试。请求失败:Operation timed out after 30000 milliseconds with 0 bytes received
工具调用兼容性 高级功能 · 14.0 / 14.0 分 通过
身份自报检查 声明一致性 · 2.0 / 2.0 分 通过
流式输出检查 协议完整性 · 7.0 / 7.0 分 通过
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
该模型触发测评预警:题目通过率 30%,低于 75%;最低能力维度 0 分,低于 30 分
deepseek-flash
DeepSeek · 平均延迟 18.62秒 · 成功率 30%(3/10 题)
31.3 分
能力分28.3
性能分47.5
一致性分5.0
首字最快用时4.74秒
首字平均用时12.76秒
每秒最大 tokens4,394.85
平均每秒 tokens1,510.11
平均响应延迟18.62秒
一致性判定:与声明特征偏差较大
五大能力维度
数学 50.0 (1/2)
逻辑 100.0 (2/2)
代码 0.0 (0/2)
中文 0.0 (0/2)
知识 0.0 (0/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 0.0 / 10.0 分 异常
动态多步计算:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
多约束逻辑推理 推理能力 · 0.0 / 10.0 分 异常
多约束逻辑推理:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
知识与概念边界 知识准确度 · 0.0 / 10.0 分 异常
知识与概念边界:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
复杂指令遵循 指令遵循 · 0.0 / 10.0 分 异常
复杂指令遵循:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
动态结构化输出 JSON 结构化 · 0.0 / 12.0 分 异常
动态结构化输出:调用失败,未通过测试。请求失败:Operation timed out after 30002 milliseconds with 0 bytes received
结构污染检查 协议完整性 · 0.0 / 8.0 分 异常
结构污染检查:调用失败,未通过测试。请求失败:Operation timed out after 30000 milliseconds with 0 bytes received
长文本定位与记忆 上下文能力 · 0.0 / 12.0 分 异常
长文本定位与记忆:调用失败,未通过测试。请求失败:Operation timed out after 30007 milliseconds with 0 bytes received
身份自报检查 声明一致性 · 0.0 / 2.0 分 异常
身份自报检查:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
工具调用兼容性 高级功能 · 0.0 / 14.0 分 异常
工具调用兼容性:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
流式输出检查 协议完整性 · 0.0 / 7.0 分 异常
流式输出检查:调用失败,未通过测试。请求失败:Operation timed out after 30001 milliseconds with 0 bytes received
响应协议完整性 协议完整性 · 5.0 / 5.0 分 通过
该模型触发测评预警:题目通过率 30%,低于 75%;最低能力维度 0 分,低于 30 分
agnes-2.0-flash
Agnes · 平均延迟 0.36秒 · 成功率 0%(0/10 题)
16.1 分
能力分0.0
性能分40.3
一致性分—
首字最快用时0.65秒
首字平均用时0.65秒
每秒最大 tokens148.58
平均每秒 tokens148.58
平均响应延迟0.36秒
一致性判定:与声明特征偏差较大
五大能力维度
数学 0.0 (0/2)
逻辑 0.0 (0/2)
代码 0.0 (0/2)
中文 0.0 (0/2)
知识 0.0 (0/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 0.0 / 10.0 分 异常
动态多步计算:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020847343925045816ylMSAqN)
多约束逻辑推理 推理能力 · 0.0 / 10.0 分 异常
多约束逻辑推理:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084734716638333mmRd3IxJ)
知识与概念边界 知识准确度 · 0.0 / 10.0 分 异常
知识与概念边界:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020847347957726542vIHcCec)
动态结构化输出 JSON 结构化 · 0.0 / 12.0 分 异常
动态结构化输出:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084735165915511bkS1nMcF)
复杂指令遵循 指令遵循 · 0.0 / 10.0 分 异常
复杂指令遵循:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084735413916795e1TQhAzd)
结构污染检查 协议完整性 · 0.0 / 8.0 分 异常
结构污染检查:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020847355364597217qc4BBCA)
长文本定位与记忆 上下文能力 · 0.0 / 12.0 分 异常
长文本定位与记忆:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084735755880736feNk3Syk)
身份自报检查 声明一致性 · 0.0 / 2.0 分 异常
身份自报检查:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084735904088071FcPopePU)
工具调用兼容性 高级功能 · 0.0 / 14.0 分 异常
工具调用兼容性:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084736107404810HotqTssx)
响应协议完整性 协议完整性 · 0.0 / 5.0 分 异常
响应协议完整性:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020847364503386835BNZqJOb)
流式输出检查 协议完整性 · 0.0 / 7.0 分 异常
流式输出检查:调用失败,未通过测试。流式响应中未提取到内容(HTTP 429):您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084737567430333CufGa38b)
该模型触发测评预警:题目通过率 0%,低于 75%;最低能力维度 0 分,低于 30 分
agnes-3.0-flash
Agnes · 平均延迟 0.31秒 · 成功率 0%(0/10 题)
0.0 分
能力分0.0
性能分0.0
一致性分—
首字最快用时暂无
首字平均用时暂无
每秒最大 tokens0.00
平均每秒 tokens0.00
平均响应延迟0.31秒
一致性判定:与声明特征偏差较大
五大能力维度
数学 0.0 (0/2)
逻辑 0.0 (0/2)
代码 0.0 (0/2)
中文 0.0 (0/2)
知识 0.0 (0/2)
一致性专项明细(11 项)
动态多步计算 推理能力 · 0.0 / 10.0 分 异常
动态多步计算:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020848023530145541tDzRwES)
知识与概念边界 知识准确度 · 0.0 / 10.0 分 异常
知识与概念边界:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084802698198858ocYX4RJh)
多约束逻辑推理 推理能力 · 0.0 / 10.0 分 异常
多约束逻辑推理:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084802740189995WwkRWTrD)
动态结构化输出 JSON 结构化 · 0.0 / 12.0 分 异常
动态结构化输出:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084803143115225bzMHJGvG)
复杂指令遵循 指令遵循 · 0.0 / 10.0 分 异常
复杂指令遵循:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084803141330887wVX1pjFe)
长文本定位与记忆 上下文能力 · 0.0 / 12.0 分 异常
长文本定位与记忆:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084803508475702TbohJeJs)
结构污染检查 协议完整性 · 0.0 / 8.0 分 异常
结构污染检查:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084803512934730mw6S3eRR)
工具调用兼容性 高级功能 · 0.0 / 14.0 分 异常
工具调用兼容性:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084803924055397ZCoTKXm6)
身份自报检查 声明一致性 · 0.0 / 2.0 分 异常
身份自报检查:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020848039513068576dYC6mUa)
响应协议完整性 协议完整性 · 0.0 / 5.0 分 异常
响应协议完整性:调用失败,未通过测试。接口报错:您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 202610020848043891433752hp0UwLe)
流式输出检查 协议完整性 · 0.0 / 7.0 分 异常
流式输出检查:调用失败,未通过测试。流式响应中未提取到内容(HTTP 429):您已达到免费用户的 API 速率限制。升级 Token Plan 即可解锁更高限额,继续不间断使用 API。 (request id: 20261002084804500491334f5JZGncD)
该模型触发测评预警:题目通过率 0%,低于 75%;最低能力维度 0 分,低于 30 分

返回排行榜

Ai速测 · 仅作能力评测与导航参考,不代表任何商业推荐 · 数据由社区提交