每天听简报,了解最新科技、AI、软件资讯
开源评估项目LiveNerf启动了一项长达三十天的持续基准评测,旨在用确定性统计数据检验前沿大模型Claude Opus 5.5在发布后是否存在悄悄变弱的暗削现象。 面对社区长期以来关于厂商可能在发布数周后通过量化蒸馏、偷偷降配或调整路由来降低推理成本的疑虑,该项目在发布初期筛选锁定了七十八道具有显著区分度的难题。 评测依托英国人工智能安全研究所的开源评测框架,固定命令行版本与提示词,每日自动化采样运行并完整公开原始评估日志。 通过摆脱主观感受的无休止争论,这种严密的前置注册实验,为大模型生命周期内的性能漂移监测建立了可复现的透明科学范式。
进度保存在本设备 · 登录同步