我们的决策模型 StartLux-Decision 开源了!A probability for every option:https://github.com/StartLuxLabs/StartLux-Decision
支持多模态和256K上下文,有量化版本
很多智能体每走一步,都要先让大模型写一段话,再从中解析出该点哪个按钮。但这些步骤大多只是一道选择题:下一步点哪里、任务完成了没有、这张工单该交给谁。用生成式模型来做,每一步都要等它把话写完,也很难知道它到底有几分把握。
StartLux-Decision 一共提供从 0.8B 到 27B 的五个尺寸。在 Decision Index 0.2.1上使用官方评测工具自测,27B 得分 63.88、9B 得分 58.63,公开榜第一的 Jev 1.13 为 57.91;38 项测试中,27B 有 31 项超过 Jev。在 Intern-Decision 的七套测试上,27B 平均准确率为 91.82%(Jev 为 88.74%)。
我们还用它做了几个 demo:在网页上自主点击下单、通关马里奥 1-1、在星际争霸 II中打赢内置 Hard 难度 AI。想在本地跑的话,我们也提供了 llama.cpp 可用的 GGUF。4B 的 Q8_0 只有 4.48 GB,在 231 道公开题上的判断结果与原版完全一致。
代码、评测脚本和原始结果都在 GitHub 上开源:
GitHub:https://github.com/StartLuxLabs/StartLux-Decision
Hugging Face:https://huggingface.co/collections/startlux-models/startlux-decision
演示视频:https://github.com/StartLuxLabs/StartLux-Decision#demos
完整评测:https://github.com/StartLuxLabs/StartLux-Decision/blob/main/docs/results.md
觉得有用的话,求个 GitHub ⭐ 和 HF up,感谢大家!

Tutti — Your all-in-one marketplace to monetize influence
活跃UV +218