#05 · 项目
TagMind 项目说明书
产品名称:TagMind
一句话定位:数字资产提炼检索 Agent —— 听懂台词、看懂画面、读懂文档,用一句话或一张图,定位文件里的那一秒。
在线体验:https://tagmind-ai.vercel.app/
主题契合:VibeHack#05「Vibe Coding for 准点下班」—— 机械的翻找交给它,真正的判断留给你。
人人都是内容记录者的时代,每个打工人和创作者的硬盘里都堆着几百 GB 的未命名文件:IMG_2042.MOV、VID_0892.mp4、录音_2026.wav、微信图片_01.jpg。
写周报:找上周那个数据,翻半小时。
写季度汇报:想不起来三个月前那版方案的配图在哪。
写年终汇报:连自己今年具体做过什么,都想不起来了。
传统工作流的四大死穴:
内容是黑盒:文字能Ctrl+F,但音视频与图片无法内文检索。找一句话只能手动拖进度条,代价是人脑持续做高消耗、低价值的辨别——一张张比对 logo、一段段听语音、一帧帧看画面;
不敢改文件名:重命名或移动路径会导致剪辑工程(Premiere / Final Cut Pro / 剪映)媒体脱机报错,破坏既有工程与相册归档;
现有 AI 工具无法沉淀资产:单点对话工具跑完就忘,写周报前依然要人工翻找素材投喂——打工人的瓶颈从来不是「写」,而是「找」;
非文本线索无处检索:品牌 logo、特定人脸、产品外观等视觉特征,根本无法用简单的文字精准描述。
【资产积累】
TagMind:导入即索引,持续留存,越用越值钱
市面工具:每次对话前手动上传,会话结束即遗忘
【检索入口】
TagMind:文字 + 以图检索(logo / 人脸 / 参考图)
市面工具:仅文字,或仅支持人脸
【判断逻辑】
TagMind:承担机械辨别,不代替审美判断
市面工具:AI 代替用户做主观筛选,易遗漏
【协作对齐】
TagMind:文件名与路径可复制,双方基于同一套坐标沟通
市面工具:结果只能截图或口述,无法精确传递
【原文件安全】
TagMind:只读索引,原文件一个字节不改
市面工具:常需重命名或移动,破坏工程链条
【资产复利】
TagMind:今年索引的素材,明年办活动直接能用
市面工具:一次性消耗,无法跨周期复用
语音转写保留词级时间戳,把声音转成可检索文本。大模型自动去除口语杂词、校对术语。
点击搜索结果,内置播放器跳转至对应位置。
自动感知景别、光影、动作与场景主体,无需依赖文件命名。
提取活动背景板、展台、海报中的文字与品牌 logo。
上传参考图即可召回目标素材:
输出文件名与路径,支持直接复制。用户不需要把素材从工具里搬出来重新组织,拿到路径即可在自己的目录、剪辑工程或交付流程中调用。
AI 自动提取并聚类标签,覆盖内容主体、情绪、视觉场景、业务归属。支持多标签组合过滤——即使完全想不起关键词,也能层层收窄。
视频素材支持按时间范围收窄检索,与标签、关键词、参考图组合使用。
日常沟通用自然语言,本地文件却全是无意义编号——这是素材协作长期低效的根源。
合作方说「所有包含 Monad logo 的照片」,这句话人能听懂,但无法直接执行。执行者要人工翻找,翻完还得把结果告诉对方,只能报一串谁也看不懂的文件名或截图列表,对方也无法核对完整性。
TagMind 让协作者的原话直接成为检索条件。系统召回全部命中素材,输出文件名完全对应的清单,支持一键复制与导出。对方照单取件,中间没有解释和确认环节。
双端使用的价值放大
单端使用,解决的是「我找得快」。
双方都在使用时,文件名从无意义字符串变成共享地址——素材交接、外部供应商协作、跨部门调用,都不再需要中间的翻译和确认环节。
这一步是从个人效率工具跨到协作基础设施的分界。
场景一:外部方素材需求响应
痛点:外部合作方提出素材需求(例如赞助商要「所有含我们 logo 的照片」),你需要从上千张未命名生图中全量找出,还要把结果准确传达给对方。
解法:上传对方 logo,限定时间范围,全量召回,导出文件名与路径清单直接发送。对方照单取件,无需解释。
场景二:长视频金句抓取
痛点:三小时的发布会录屏,想找老板关于「预算超支」那句话,拖进度条要十几分钟。
解法:搜「预算超支」,播放器跳转至 01:47:23。
场景三:年终汇报的项目还原
痛点:写年终总结,遗忘上半年具体做过的项目、当时用的图表和白板照。
解法:按时间轴与标签聚合展开,找回随手拍的白板讨论图和方案配图。素材摊在面前,判断和成稿仍由你完成。
场景四:接手他人素材库
痛点:同事交接一个几百 G 的文件夹,全是 IMG_1042.MOV。
解法:跑一遍索引即可检索。检索成本不再随使用人数重复发生。
价值定位
传统素材翻找要求人脑持续执行高负荷的琐碎判断:肉眼比对 logo、人耳分辨语音、逐帧检查画面。单条判断都不难,但量大之后成本极高,且完全无法沉淀——这次翻完,下次还要从头再翻一遍。
TagMind 通过多模态解析承担这类判断,替代的不是「思考」,而是「为了思考而必须先完成的翻找」。
协作场景的溢价
多数效率工具的价值随使用人数线性增长。TagMind 在协作场景中不同——当协作双方都在使用,沟通与核对环节被整体消除,价值高于两个单用户之和。
这决定了它的商业形态可以从个人订阅延伸到团队与企业部署,而不只是按人头卖 license。
分层变现
7 天突击包:面向展会周、汇报周、大促剪辑周的短期高频需求。
Pro 订阅(月 / 年):持续资产索引、人脸聚类、批量导出。
B 端私有化部署:打通企业 NAS 与团队局域网,消除跨部门素材索取与重复沟通损耗。
前端:Next.js + React + Tailwind CSS + Web Audio/Video API
零破坏文件访问:基于浏览器 File System Access API,只读授权。不重命名、不移动路径、不写入文件属性。
多模态处理流水线
数据处理说明:索引与标签存于本地,不上传。调用云端模型时,仅传输必要的音频切片与关键帧,不上传完整原始文件。未来支持接入本地模型,实现全链路离线。
已实现:文件夹导入与文件选择、四类资产解析与索引、自然语言检索、logo 识别、人脸识别与分类导出、视频时间范围筛选、文件名与路径复制、MEDIA / DOCS 分区、模型配置。
规划中:检索结果清单的多格式导出、FCPXML 时间线导出、在线相册直读、本地模型离线支持。
已知约束:索引为后台批处理,非实时。大体量素材需预先完成索引。
活动摄影交付普遍采用在线相册链接。用户为了检索,需先全量下载到本地,导入索引,检索完再回相册下载所需照片。
一场活动数百张高清照片,下载与导入耗时可能超过检索本身。本地存储占用与二次搬运是纯冗余。
方案:直接读取在线相册链接,完成索引与检索,输出符合原相册命名规范的文件名清单,用户凭清单回相册精准下载。
环节对比:
对高频处理外部相册的角色,这一环节的价值可能高于检索本身。
TagMind 不是替职场人制造更多平庸内容,而是消灭最机械、最重复、最不值得加班的翻找体力活。
过去,文件名告诉你它叫什么。现在,TagMind 告诉你它里面有什么。
我们用亚马逊quick agent制定了skill:Craft-Architect,发布在https://github.com/0xjonathon/craft-architect ,并用它进行了最终项目优化。