每天听简报,了解最新科技、AI、软件资讯
一个名为 Pac-Bench 的开源基准评测针对当前主流大语言模型展开了一项别开生面的工程挑战,严格考察各大模型在零上下文先验下一次性编写完整吃豆人游戏的代码实现能力。评测套件并未采用常规的玩具级片段,而是设计了严苛的多维度机器验收脚本,涵盖了滑动操控防误触、零死角的完整迷宫生成、arcade 街机级幽灵路径追踪算法,甚至包括利用原生接口纯代码实时合成双声部连续警报音效。实测数据显示前沿推理模型斩获了近乎满分的九十九分优异战绩,无论是游戏状态机的完备性还是音频总线的设计均令人惊艳。讨论区指出,这种高复杂度的端到端交互项目测试,为评估模型在真实软件开发中的长程架构能力设立了绝佳标杆。
进度保存在本设备 · 登录同步