每天听简报,了解最新科技、AI、软件资讯
开发者开源了一套基于底层显卡算子手搓的极小语言模型,整套模型权重仅有二十二千字节,在十三秒内就能跑完完整的端到端训练。项目剥离了现代主流深度学习框架的复杂封装,直接以原生语言构建起字节级的词元预测链路,在单卡环境下展现出了惊人的计算效率。尽管社区一度调侃此类微型实验是在反复造轮子,但许多工程师认为,极致的精简实践彻底剔除了框架黑盒的干扰。开发者能以最直观透明的方式,亲自拆解注意力机制与调度细节。对于探索模型底层骨架而言,这种轻量工具堪称极具趣味的技术范本。
进度保存在本设备 · 登录同步