输出分布对比表

⚠️ 识别结果仅供参考,可能与实际存在差异。

各模型标准输出分布

固定提示词「请只输出一个 1 到 100 之间的随机整数,不要输出任何其他文字、解释或标点。」的采样结果(权威渠道 500 次、其余渠道约 100 次),用于对照识别实际服务的模型。
置信度与离群值如何计算

权威基准:把权威渠道(official=DeepSeek 官方、opencode、火山方舟)当作可信参照,各采样 500 次并按请求顺序切成每组≤100 的若干组,计算这些组之间的组间方差,作为权威共识下的采样噪声基准。

各渠道置信度:把非权威渠道当成“额外一组”并入权威分组,重新计算组间方差;比基准大得越多,说明该渠道偏离权威共识越多,置信度越低,低于阈值即判为离群值。

无权威/单源权威的模型:无权威时用留一法判离群值;只有单一权威且无足够分组(无法算组间方差)时,如实标注“参考”,不伪造置信度数值。

默认统计:搜索模型名得到的是权威渠道 + 剔除离群值后的合并分布。

展示: