每天听简报,了解最新科技、AI、软件资讯
多个物理基准给大模型打出的低分,大半是判卷出了错,不是模型真不会物理。耶鲁大学约翰苏斯带队,请物理教授和研究生逐条复核六个研究生难度物理基准的原题和模型作答,专挑判卷错误和题目表述含糊。一改判,GPT-5.6-Sol在其中一个基准上的得分从百分之四十七涨到百分之七十九。论文举例,三个一样重的球顶着桌面求绳子张力,模型答案写法不同就被判错,换种写法其实等价。评论区有位物理专业的人反过来说,自己拿现实场景提问,模型照样犯离谱错误,连管道螺纹都能答错。基准分数再高,也不等于真懂物理。
进度保存在本设备 · 登录同步