【React专项实测:GPT-5.6 Sol第一,但最好成绩仅43.1%】
【React专项实测:GPT-5.6 Sol第一,但最好成绩仅43.1%】7月16日消息,专做 React 开发工具的 Million 团队推出 ReactBench v1,测试 AI 编程 Agent 能否完成真实的 React 开发任务,并避免引入新的代码问题。 React 是用于构建网站和 App 界面的主流 JavaScript 库。Million 此前开发了 React Scan、React Doctor 和 Million.js 等开源工具。 ReactBench 从开源项目中筛出 51 项真实任务。除了检查功能能否运行,它还用 400 多条规则排查程序错误、性能、无障碍和代码质量问题。 GPT-5.6 Sol 以 43.1% 的综合得分居首,Fable 5 为 41.2%。官方称两者差距较小,暂时无法确认 Sol 明显更强。同为 XHigh 配置时,Fable 5 的单次测试成本约为 Sol 的 6.3 倍。 即使是成绩最高的配置,成功完成的任务也不到一半。在 4455 次新功能开发测试中,各模型共引入 1194 个 React 问题,其中 77.5% 是程序错误或安全问题。
免责声明:
内容来源金色财经、欧意交易所、gate.io交易平台以及Binance交易所官网
本站不对其做任何背书,也不代表赞成作者观点,如有失察或对您造成影响,可联系我们删除
内容来源金色财经、欧意交易所、gate.io交易平台以及Binance交易所官网
本站不对其做任何背书,也不代表赞成作者观点,如有失察或对您造成影响,可联系我们删除

还没有评论,来说两句吧...