每天听简报,了解最新科技、AI、软件资讯
一项名为 Real-SWE 的全新大模型编程评测基准引发业界震动。与以往多基于开源代码、极易发生训练集污染的传统基准不同,该团队直接从企业授权的未公开私有生产库中提取真实工程难题,涵盖跨微服务改造、复杂计费与财税逻辑等真实业务场景。评测结果给虚火过旺的编程大模型结结实实泼了一盆冷水:当前全球最顶级代码智能体的真实业务解决率仅在百分之三十多徘徊,远低于公开榜单上的惊人分数。社区对此一片叫好,认为脱离了被过拟合污染的公有仓库,大模型在面对复杂的遗留系统和真实商业架构时,距离真正替代专业工程师还有极其遥远的距离。
进度保存在本设备 · 登录同步