Claude Opus 4.6 被 nerfed(削弱)了
- BridgeBench 幻觉基准显示,上周 Claude Opus 4.6 准确率 83.3%(排名第 2),今日重测降至 68.3%(排名第 10),幻觉率几乎翻倍(增加 98%)。
- 多位用户反馈模型推理能力明显下降,简单编码任务也频繁出错,引发对 Anthropic 暗中降低性能的质疑。
- 部分观点指出基准任务数量不同(之前 6 个 vs 今日 30 个),共同任务得分接近,可能存在统计噪声,但用户信任已受重创。
链接:https://www.bridgebench.ai/
BridgeBench 是一个专注于 AI 编码能力 的基准测试平台(AI Coding Benchmark)。它包含 130+ 个真实世界任务,覆盖算法、调试(debugging)、重构(refactoring)、代码生成、UI 生成、安全检查、创意 HTML 等多个维度。除了准确率,还会评估速度、成本、完成率、幻觉率(hallucination/fabrication) 等实际使用指标。