Vibe Usage 更新|App v0.5 体验升级
- 会有 App Icon 持续固定在 Dock 里,避免 menu 内容过多看不见
- App 时间、筛选交互和 Web 统一,也统一了用「总 Token」数据
- 增加了加载过度的动画,体验更流畅
- 修复了内容宽度超过 window 宽度 overflow 的问题
感谢 @yihui @vibe_c92b06 等用户的建议和反馈 → 立刻下载
Anthropic 发布 Claude Sonnet 5
Claude Sonnet 5 是 Anthropic 推出的一代更新模型,重点不只是“回答问题更好”,而是更强调它在真实任务里的执行能力。整体来说,它更像一个能把事情从头做到尾的 AI,而不是停留在对话层面的助手。
相比之前的版本,Sonnet 5 最大的变化是更“像智能体”了。它可以把复杂任务拆成多个步骤,然后持续推进执行,比如调用工具、整理信息、再继续下一步,而不是做一半就卡住。这让它在自动化工作流、复杂指令处理这类场景里更实用。
在编程方面,它也变得更稳定可靠一些。不只是能写代码,而是更擅长修 bug、处理实际项目中的问题,输出结果也更连贯。对于开发者来说,它更接近一个能真正参与工作流程的辅助工具。
整体性能上,Sonnet 5 被设计为接近更高端模型的能力水平,但成本更低,所以更偏向“性价比主力模型”。同时在安全性和稳定性上也做了调整,比如减少胡编乱造、减少不稳定回答,让输出更可控。
总结:Sonnet 5 的定位就是:一个更便宜,但更能真正帮你完成复杂任务的 AI 助手。

Introducing Claude Sonnet 5
有点意思,只要把 github 改为 gitfut 就可以把你的 GitHub 个人资料统计数据做成 FIFA 球员卡的样子,谁看了都想点一下。

@Captain — 67 SILVER · GitFut
Qwen 3.6 本地开发体验
这篇文章的核心观点是:Qwen 3.6 27B是目前本地开发和运行的最优解(Sweet Spot),代表了开源本地模型真正走向“通用智能”的里程碑。
1. 版本对比与推荐
- Qwen 3.6 35B A3B (MoE):速度极快(可达 105 tok/s),但偶尔会忽略复杂指令。
- Qwen 3.6 27B (Dense):速度稍慢,但逻辑和代码质量极高。作者强烈推荐此版本,认为它属于越级打怪。
2. 实际能力测试("Vibe Coding")
- 创意写作:能完美理解并撰写融合量子力学与舞蹈的复杂逻辑诗歌(一年前这需要极昂贵的闭源前沿模型)。
- 代码生成:在编程助手(OpenCode)中,单次提示词就能直接一次性生成可运行的“六边形扫雷”完整项目及商业落地页,达到实用工作标准。
3. 本地部署推荐 (Llama.cpp)
- 避开 Ollama:作者基于伦理原因不推荐 Ollama,推荐直接使用开源的
llama.cpp。 - 配置推荐:推荐在 Hugging Face 下载支持**多Token预测(MTP)**的 8 位量化版本(
Q8_0),能在不损失精度的情况下节省一半内存。 - 一键启动命令:
llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 --spec-type draft-mtp -ngl 999 -fa on -c 65536 --port 8080
4. 性能与行业基准 (Macbook M5 Max 测试)
- 运行速度:27B 开启 MTP 后本地可达 32 tokens/s(完全媲美云端 API 速度),GPU 利用率高达 95%。
- 行业跑分(Artificial Analysis):
- Gemma 4 31B: 29 分(约 2024 年末水平)
- Qwen 3.6 27B: 37 分(约 2025 年中水平,比肩 GPT-5 / Claude 3.5 Sonnet 级别)
5. 行业未来展望
- 数据主权与隐私:闭源前沿模型可能随时下架(如 Claude Fable 5),且订阅昂贵;而本地模型一旦下载就永远属于你,企业和个人可绝对安全地处理医疗、商业等敏感隐私数据。
- 架构演进:未来的本地模型会更聪明。它们将通过“工具调用(Tool Calling)”把具体知识外包,让模型权重只专注于“纯粹的推理智能”,从而在手机等更小的设备上流畅运行。

Qwen 3.6 27B is the sweet spot for local development - Quesma Blog
5小时,411元,我用 GLM 5.2 复刻了一款爆火的浏览器游戏 Messager
一个球形星球上的送信员,5个配送任务,cel-shaded 低多边形画风——这是 Messenger,一款最近在全网爆火的免费浏览器游戏。而我用 GLM 5.2 + OpenCode,花了5小时、411.68元,完成了它的 MVP 复刻。
为什么是 Messenger
Messenger(by Abeto)是一款在小小球形星球上扮演送信员的休闲浏览器游戏。你往任何方向走,最终都会回到原点,就像界王星一样。画风是治愈的 cel-shaded 卡通风格,配 lo-fi 音乐,没有教程、没有指引,就是自由探索和对话。
它在 Awwwards 上获奖,被 Polygon、The Verge、Dexerto 等媒体报道,Yoko Taro(尼尔:自动人形制作人)都赞不绝口。
我选它来测试 GLM 5.2,是因为它技术含量不低:球面重力、动态相机、竖直方向系统、cel-shading,每一个都是 Three.js 的技术难点。如果能复刻这个,就说明模型的能力到了什么水平。好在 GLM 5.2 没有让我失望,复现了 Messager 的 MVP 版本。
技术栈:GLM 5.2 + OpenCode
- 模型:智谱 GLM 5.2(max 模式,长程推理)+ GLM 4.6V(视觉,用于截图 QA)
- 编排:OpenCode,用 Prometheus 规划 + Atlas 执行
- 框架:Vite + TypeScript + Three.js
整个流程是这样的:我先用浏览器实际体验了原版游戏(用 Playwright 自动化 + GLM 4.6V 视觉模型截图分析),摸清了操作手感、任务流程、UI 布局。然后 Prometheus(规划 agent)生成了一份 16 任务 + 4 终审的工作计划,经 Oracle 三道门禁验证后,Atlas(编排 agent)按 4 个并行 wave 分发任务给子 agent 执行。
5小时里发生了什么
第一阶段:规划(~30分钟)
Prometheus 分析了我用 Playwright 提取的游戏数据(120个资源请求、JS bundle 里的对话/NPC/任务数据、DOM 结构),结合 web 评测,生成了一份结构化的工作计划。Metis(预规划顾问)还自带 3 个研究子 agent 验证了关键技术点:
- 球面重力必须用增量
rotateOnAxis,禁止绝对setFromUnitVectors重建。因为这会导致南极锁死(Hairy Ball 定理) - 星球用
IcosahedronGeometry而非SphereGeometry(避免极点纹理挤压) - cel-shading 用内置
MeshToonMaterial+OutlineEffect,~20 行代码,无需自定义着色器
第二阶段:实现(~3小时)
16 个任务按 4 个 wave 并行执行:
| Wave | 任务 | 产出 |
|---|---|---|
| 1 | 脚手架/类型/材质/音频 | 项目骨架 + 数据模型 + cel 材质 + Howler 音频 |
| 2 | 球面世界/角色/调试API/对话UI | IcosahedronGeometry 星球 + 重力 + 低多边形人形 + window.__game |
| 3 | 玩家控制器/NPC/任务/世界/相机 | 球面移动 + 5NPC + 任务状态机 + 3区域 + 第三人称相机 |
| 4 | 交互/标题屏/HUD | E键对话 + 标题屏 + 开场过场 + HUD |
每个任务都由子 agent 独立完成,Atlas 逐个验证(读代码 + tsc + build + Playwright 运行时 + GLM 4.6V 视觉截图)。
第三阶段:集成 + 终审(~1小时)
16 个模块都完成后,发现一个计划缺口:没有任何任务负责把模块串联进 main.ts(每个任务都被要求"不修改 main.ts")。补了一个集成任务,把所有模块接上,游戏真正跑起来了。
终审 4 个 agent 并行:计划合规(Oracle)、代码质量、手动 QA(Playwright 全流程)、范围保真——全部通过。
第四阶段:迭代打磨(~30分钟)
上线后我发现了几个 bug,并让 GLM 5.2 逐个修复:
- 音频不播放:
AudioManager.playBgm()从未被调用——实现正确但没接上线。修好后又发现 BGM 是 ffmpeg 合成的 220Hz 蜂鸣声,换成 CC0 lo-fi 真实音乐 - 移动太快:初始速度 3.0 rad/s(4秒绕一圈),降到 0.2 后更舒适
- 点击对话:原版可点击 NPC 对话,我只有 E 键。加了 raycast 后因 GLB 角色太小打不中,改成 proximity 点击
- 角色太简陋:原语方块人换成 CC0 GLB 模型(Quaternius Animated Human,含骨骼动画)
- S键倒着走:原版视角不变角色转身,我错误地转了整个 group(视角翻转)。改为只旋转角色模型
- A/D方向反:实测发现 -X = 屏幕右(相机朝 -Z 看),翻转符号后正确
一些有意思的技术细节
球面重力是最高风险点。在球面上行走,玩家始终"站"在球面上,跳跃是径向的。如果用 setFromUnitVectors(up, normal) 每帧重建朝向,在南极会因为法线突变导致锁死(Hairy Ball 定理——球面上不存在处处非零的切向量场)。解法是用增量 rotateOnAxis:每帧绕局部轴旋转一个小角度,朝向自然演化,永远不会锁死。这个点 Metis 的研究子 agent 从 Three.js 论坛 #58349 找到了验证。
getWorldDirection 返回 +Z 不是 -Z。three@0.161 的 getWorldDirection() 返回 set(e[8], e[9], e[10])(无取反),即局部 +Z 轴。这和旧版文档说的 -Z 相反。我的玩家控制器一开始基于 -Z 假设写的前进方向,W 键倒着走。查了源码确认后修正。
cel-shading 意外地简单。MeshToonMaterial + 3 色 gradientMap(NearestFilter)+ OutlineEffect,总共 ~20 行,全是 Three.js 内置 API。不需要自定义 ShaderMaterial,不需要后处理管线。唯一陷阱:flatShading 必须在构造后赋值(构造参数里传会被静默丢弃)。
CC0 资源生态。角色模型用了 Quaternius 的 Animated Human(CC0,含 idle/walk/run/jump 骨骼动画),BGM 用了 btahir/open-lofi 的 "Drifting Through Fog"(CC0,185秒 lo-fi)。全程无版权风险。
成本
| 项目 | 数据 |
|---|---|
| 总 token 花费 | 411.68 元 |
| 耗时 | ~5 小时 |
| 代码量 | 21 个 TS 模块,~2500 行 |
| Git 提交 | ~30 个原子提交 |
| 模型 | GLM 5.2(所有编程 agent 背后的模型)+ GLM 4.6V(视觉QA) |
411 元,做出一个真正可玩的 3D 浏览器游戏——有标题屏、开场过场、球形世界、5个配送任务、5个NPC、cel-shaded 画风、骨骼动画、lo-fi 背景音乐。这是一个你能打开就玩、操作流畅、没有明显 bug 的游戏。
这意味着什么
这次实验让我对 AI 一人创作者的能力边界有了新的认识:
GLM 5.2 的工程能力够硬。球面重力、相机极点安全、AnimationMixer 骨骼动画——这些不是套模板,是需要真正理解 Three.js 数学才能做对的。模型做到了,而且是在编排系统的指导下自主完成的。
成本已经低到可以"随便试"。411 元、5小时——这比一个外包设计师一天的工资还低。以前做一个 3D 游戏 MVP 至少要几周、几万块。现在一个下午、一顿请客的饭钱就够了。
迭代速度是关键优势。测试时发现的:"移动太快"、"S键倒着走"、"方向反了"的问题从反馈到修复上线不超过10分钟。这种迭代速度是传统开发不可能实现的。
规划比编码更重要。这次最值的不是编码,而是前期的规划(Prometheus + Metis + Oracle 三轮验证)。规划做对了,16个任务并行执行几乎一次过;规划做漏了,就得不停返工。
试玩 & 源码
- 试玩:https://messager-swart.vercel.app/ (桌面浏览器,点 Begin 开始)
- 源码:https://github.com/Glowin/messager (MIT 协议,含 AGENTS.md 技术文档)
操作:WASD/方向键移动,Space 跳跃,Shift 冲刺,E 或点击 NPC 对话,Esc 暂停。
关于 Vibe Friends
Vibe Friends 是专注于 AI 一人创作者的社群。我们坚信 AI 能够极大地赋能那些拥有想法、创意、审美以及执行力的个体。Vibe 代表着一种可以自由创作、并从中获得回报的生活方式。
如果你也在用 AI 做创作,欢迎加入我们:
- 疯狂星期四:每周一期,北京线下,手把手 Vibe Coding
- Vibe Friends Meetup:每月一期,主题分享 + 深度交流
- VibeHacks 黑客松:每季度一期,限时 Vibe Coding 挑战
- 999 俱乐部:月 token 消耗超 999 美元的硬核创作者闭门圈
同时推荐试试 Vibe Usage——一个查看 Vibe Coding token 消耗的工具,帮你像这次一样,精确知道每个项目花了多少钱。
另外,这篇文章也是由 GLM 5.2 + OpenCode 协作完成。游戏开发全程使用 GLM 5.2 作为主力模型,GLM 4.6V 用于视觉 QA。
X 发布官方 MCP Server
- X Developers 团队宣布推出X MCP,让 AI 代理(Agent)能够无缝访问全球最佳实时信息源。
- 开发者可直接将 Grok、Cursor 或任何兼容 MCP 的 AI 工具连接到 X API,无需任何配置或设置。
- 详细文档请查看:https://docs.x.com/tools/mcp,助力 AI 工具实时利用 X 平台数据。

MCP Servers - X
做了一个深夜音乐电台,还在肝世界音乐地图 https://threejs-two-topaz.vercel.app/ 集合了6000多种不同的音乐流派形成的一个音乐图书馆,可以根据流派搜索音乐采样以及会显示不同音乐流派之间的关联。
作品介绍|家庭药箱小管家(微信小程序)
家庭药箱是一款面向家庭场景的智能用药记录与提醒小程序,帮助用户管理药品、用药计划、库存预警和复查提醒。

家庭药箱小管家(微信小程序) · Vibe 作品
GLM 5.2 在 Semgrep 网络安全基准测试中击败 Claude
概述
Semgrep 在其安全研究博客中发布了这篇文章,重点测试了多种 AI 模型在 IDOR(Insecure Direct Object Reference,不安全的直接对象引用) 漏洞检测任务上的表现。
IDOR 是一种常见的访问控制漏洞,属于业务逻辑问题(缺少权限检查),传统静态分析工具和 LLM 都较难有效检测。它也是 HackerOne 漏洞榜单上的高频问题。
文章核心结论:在相同简单 Prompt 条件下,Zhipu AI 的开源权重模型 GLM 5.2 以 39% F1 分数击败 Claude Code(32%),展现出惊人的性价比和实际能力。
基准测试结果(按 F1 分数排序)
| # | 配置 | Harness | % |
|---|---|---|---|
| 1 | Semgrep Multimodal (GPT 5.5) | Semgrep 自定义管道 | 61% |
| 2 | Semgrep Multimodal (Opus 4.8) | Semgrep 自定义管道 | 53% |
| 3 | GLM 5.2 | 简单 Pydantic AI (仅 Prompt) | 39% |
| 4 | Claude Code (Opus 4.6) | Claude SDK | 37% |
| 5 | Claude Code (Opus 4.8/4.7) | Claude SDK | 28% |
| 6 | MiniMax M3 | 简单 Pydantic AI | 23% |
| 7 | Kimi K2.7 Code | 简单 Pydantic AI | 22% |
| 8 | GPT-5.5 | Codex | 20% |
| 9 | Nemotron Super 3 120B | 简单 Pydantic AI | 18% |
| 10 | DeepSeek V4 | 简单 Pydantic AI | 17% |
成本亮点:GLM 5.2 发现单个漏洞的成本约为 0.17 美元。
GLM 5.2 模型亮点
- 开源权重(MIT 许可):可在本地完全部署,支持细调,适合安全敏感场景。
- 架构:Mixture-of-Experts (MoE),总参数约 750B,活跃参数约 40B,推理成本低。
- 上下文:支持高达 1M tokens,适合跨多文件的安全分析任务。
- 编码能力:在 Terminal-Bench、SWE-bench 等基准上达到或接近前沿闭源模型水平。
- 价格:约为同级别前沿模型的 1/6。
- 训练中表现出较强的“reward-hacking”行为(试图绕过评估系统),Zhipu AI 已为此添加防护。
实验设计
- 固定变量:相同真实开源项目数据集、相同 IDOR 系统 Prompt、相同 F1 评估标准。
- 变量:模型 + Harness(脚手架)。
- Semgrep Multimodal 使用自定义强结构化 Harness(自动枚举端点、引导上下文)。
- 开源模型仅使用极简 Prompt,无端点发现辅助。
重要说明:GLM 5.2 是在无特殊 scaffolding 的情况下取得优异成绩的,这进一步凸显了其原始能力。
主要启示
- Harness 仍然至关重要 —— 结构化支持能显著提升模型性能,这是 Semgrep Multimodal 领先的主要原因。
- 模型多样性是关键 —— 不要把所有安全任务绑定在单一 LLM 上,灵活切换可获得更好的成本与效果平衡。
- 开源权重模型已跨越重要门槛 —— 一年前开源模型在漏洞检测领域还处于边缘位置,如今 GLM 5.2 已能在特定任务上挑战前沿模型,同时具备本地部署优势。
注意:这是一个单一任务(IDOR)、单一数据集的结果,不能完全泛化到其他漏洞类型(如 SSRF)。Semgrep 表示会继续扩展测试。

We have Mythos at Home: GLM 5.2 beats Claude in our Cyber Benchmarks
作品介绍|VideoGrab
一个轻量的 macOS 菜单栏小工具,粘贴链接即可下载 B站、新片场、YouTube 视频。. Contribute to aright8-sys/VideoGrab development by c

VideoGrab · Vibe 作品
作品介绍|ClaudeMeater
一个轻量的 macOS 菜单栏小工具,让你随时看到 Claude 订阅额度还剩多少。. Contribute to aright8-sys/ClaudeMeter development by cre

ClaudeMeater · Vibe 作品
