每天听简报,了解最新科技、AI、软件资讯
一个人用纯 PyTorch,从零手写了十几种主流大语言模型的架构代码,放进一个叫 OpenArch 的项目里,专门拿来对比着读。这些代码不是给你拿去跑生产的,目的是让人一眼看清 Llama、DeepSeek、Qwen、GLM 和 Kimi K2 这些模型,在注意力机制、归一化和位置编码上到底差在哪儿。比如 DeepSeek 和 Kimi K2 都用了多头潜在注意力,Gemma 三代和 Mistral 三代却用带滑动窗口的分组查询注意力,写法完全不同。评论区有人真读出了一个 bug,Kimi K2 的路由代码里,专家数量和该选的数量传错了,作者当场认错并修好。也有人问,光靠读代码,怎么知道实现和官方权重跑出来的结果一致,作者的回答很实在,只能拿 HuggingFace 上的官方实现去对照。项目目标是覆盖七十二种架构,现在完成了十五种,作者在评论区反复喊话缺人手。
进度保存在本设备 · 登录同步