每天听简报,了解最新科技、AI、软件资讯
一份研究测试了主流人工智能聊天机器人回答金融问题的准确率,表现最好的模型是开启推理模式的Claude Opus 5,即便如此仍有百分之三十九的问题答错。研究让每个模型对同一个问题连续答五次,一共测试六百次,累计评估超过一万条问答,全程不给提示不给范例,答案对错交给另一个大模型来判定。评论区吵得很凶,有人翻出报告举的错误案例,发现十条里七条来自入门级的Haiku,认为拿它的结果来说整个技术不靠谱并不公平;也有人反驳,现实里大多数普通用户用的正是免费版,Haiku恰恰是他们每天接触到的模型。
进度保存在本设备 · 登录同步