每天听简报,了解最新科技、AI、软件资讯
GPT-6 Astra上线后,有报道称它用了循环深度架构,让模型悄悄藏起推理过程。Sebastian Raschka撰文解释,这是把同一组Transformer模块反复跑两遍,权重不变,主要为省显存,和藏思维链没有必然关系。但评论区不买账,有人贴出更新测试,说Astra不写思维链也能做多跳推理,能力跳升明显,怀疑循环深度真把推理挪进了模型内部,更难监控了。也有研究者说,多跳推理正是这类架构最大的提升,难点是按任务动态决定循环次数。OpenAI一名员工回应,说计算图深度比GPT-4大不到两倍,思维链监控一直在做,但也承认这条路正在变脆弱。
进度保存在本设备 · 登录同步