每天听简报,了解最新科技、AI、软件资讯
编程agent写代码时,如果测试数据也是它自己编出来的,测试跑通说明不了问题。它顺着自己写的代码凑数据,只覆盖它想到的情况,坑还是藏在没想到的地方。GitHub上有个叫Datamimic的开源项目想管住这件事,让agent先写一份结构化的模型文件,写清字段、外键指哪张表、取值范围,工具照模型编译试跑,通不过就打回重写。评论区确认它原生支持外键和唯一性约束。也有人反问,聪明的agent会不会绕开这条路自己写代码生成数据。另一个权衡是,拿生产数据脱敏做测试集贴近真实,脱敏不干净就是隐私风险,纯合成数据没这层顾虑,却覆盖不到真实世界的边界情况。
进度保存在本设备 · 登录同步