【Qwen3.8 Max重测后追平Opus 4.8】

55分钟前
【Qwen3.8 Max重测后追平Opus 4.8】8月7日消息,评测机构 Artificial Analysis 重测 Qwen3.8 Max 后,将其 Intelligence Index 从 53 分上调到 56 分。此前测试接口出现间歇性异常,这次改用阿里云官方 API 重跑。新成绩追平 Claude Opus 4.8,但仍比 Kimi K3 低 1 分。 千问进步最明显的是 Agent 任务。GDPval-AA 得分达到 1739,超过 Kimi K3 的 1685 和 GPT-5.6 Sol 的 1730,仅落后 Claude Opus 5。终端操作、科学推理和编程评测也普遍上涨。 代价是更费 Token。Qwen3.8 Max 的 Token 单价比上一代更低,但完成一道综合评测任务的平均成本,仍从 0.53 美元涨到 1.14 美元,高于 Kimi K3 的 0.86 美元。主要原因是它在 Agent 任务中调用更多轮次,生成的内容也更多。 它的知识可靠性还出现倒退。AA-Omniscience 准确率基本没变,幻觉率却从上一代的 23% 升到 40%。
免责声明:
内容来源金色财经、欧意交易所、gate.io交易平台以及Binance交易所官网
本站不对其做任何背书,也不代表赞成作者观点,如有失察或对您造成影响,可联系我们删除

发表评论

快捷回复: 表情:
AddoilApplauseBadlaughBombCoffeeFabulousFacepalmFecesFrownHeyhaInsidiousKeepFightingNoProbPigHeadShockedSinistersmileSlapSocialSweatTolaughWatermelonWittyWowYeahYellowdog
验证码
评论列表 (暂无评论,3人围观)

还没有评论,来说两句吧...