每天听简报,了解最新科技、AI、软件资讯
一款叫 jev 的决策模型,在新榜单 Decision Index 0.1 上打败了三十多个开源决策模型。 这份榜单由开发者 multimodalart 制作,给每个模型出了十三万道题,覆盖知识、自动化、理解和创造力。 jev 综合领先,知识类题目优势明显,作者提到这可能只是因为模型更大。工具调用、自动化和分类上,它和对手差距很小。 所有模型都在同一块 RTX 6000 PRO 显卡上测试,结果可比。 jev 的短板也很清楚:象棋这类推理解谜游戏、高难度文档检索、从乐谱识别和弦,它都表现平平。 它真正擅长的是研究生水平的知识问答、挑选 Python 函数、调用工具和给模型分配任务。 评测方法和代码全部开源在 GitHub 上,谁都能照着复现一遍,验证这份榜单的结论。
进度保存在本设备 · 登录同步