每天听简报,了解最新科技、AI、软件资讯
Whistle 语音识别模型只有十六点九 M,能直接用 CPU 在设备上把录音转成文字。它支持英语、德语等七种语言,暂时没有中文,每次最多处理三十秒音频。开发团队在苹果 M4 Pro 上测试十秒录音,首个文字约十一毫秒出现。这是整段录音送入后的处理时间,不能当成边说边出的延迟。它还能给每个词标时间,并和同一家公司的工具调用模型共用引擎。比如一句关闭厨房灯的录音,可以接着转成控制灯光的指令。网页演示的音频也留在本机,适合先试自己的口音和使用场景。
进度保存在本设备 · 登录同步