Qwen3.8 27B 英文单词加法基准测试结果
热点事件观察中
Qwen3.8 27B 英文单词加法基准测试结果
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
Simon Willison 用 5,070 个禁用推理的案例测试本地 Qwen3.8-27B-Q4_K_M.gguf 模型能否仅用英文单词完成正整数加法,数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加下降,一至三位数为 97.04%,十至十三位数降至 6.44%。 Willison 随后启用推理重测,因每对耗时更长,每个组合只跑一次,169 次配对测试中答对 167 次。他称这些是一次性测试,再跑一次结果会不同。
AI 根据报道生成 · 15 小时前更新
最新进展10月5日 07:34
Qwen3.8 27B 用英文单词做加法的基准测试报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Simon WillisonQwen3.8 27B 用英文单词做加法的基准测试
一项基准测试用 5,070 个禁用推理的案例检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否仅用英文单词完成正整数加法,禁用推理时数值准确率为 23.57%,格式合规率 96.17%。准确率随位数增加从一至三位数的 97.04% 降至十至十三位数的 6.44%。启用推理后,169 次配对测试中答对 167 次。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。