
我对象是一家电商公司的法务,日常有个很琐碎但又必须极度谨慎的活:审查商品详情页的广告合规。
前阵子她领导离职了,原本两个人分担的审查压力,一下子全压在她一个人身上。大促和新品排期接着来,每天都有几十张详情页长图等着过。
最开始,我想着用现成的 AI 帮她顶上。我在 Hermes 里给她配了一个专门的 Agent,把化妆品合规、广告法调查应对的几个 Skill 和法规知识库都挂了上去。
但真实业务一跑起来,Agent 彻底翻车了。
对话框里的真实翻车现场
平时偶尔扔一两张图去问法条,Agent 确实能给点参考。但当它面对“每天几十张详情页、每套物料必须严谨对齐备案、还要输出固定格式表格”这种高压生产场景时,聊天框的短板暴露得极其彻底。
首先是速度慢到崩溃。 Hermes 的 Agent 本质上是单线程串行的。一套详情页切成十几张图发过去,它只能一张一张读、按顺序想、挨个吐字。在群里被运营催着要审查结果的时候,坐在电脑前等 Agent 在对话框里慢慢排队吐字,这种等待极度消耗心智。
更致命的是质量严重不稳定。 法务审查对确定性的要求极高:既要对照产品的特定备案功效(比如普通洗发水能不能提去屑、护发素能不能提控油),又要扫几百条禁用词库,最后还要输出严格对齐的 Excel 表格。
当知识库、多轮 Prompt 和长图全塞在同一个会话里,上下文越拉越长,模型不可避免地开始“脑雾”——前几页审得好好的,到后面就开始漏看违规词;或者前面判了高风险,后面同类词又放过了;吐到最后的表格格式甚至直接错位。
那一刻我很清楚:不是模型能力不行,而是聊天框这个 Harness(运行外壳),根本不适合这种生产任务。
换个思路:用 Vibe Coding 搓一个专用的 Harness
既然对话框接不住,那就针对这个场景手搓一个专用的界面。
我本身没有正经写代码的底子,写这个东西我用的是 OMP 里的 gpt5.6sol。
很多人觉得让 AI 写项目容易翻车,我这次做下来最大的感受是:千万不要让 AI 一次性交付一个完整的大系统。
如果一开始就对 AI 说“给我做一个全自动法务审查系统”,它大概率会自作聪明地搞出一堆花哨但跑不通的玩意(比如全自动长图识别切片、复杂的全自动对齐)。我做的事情其实是把边界砍得非常死:
- 坚决不做自动切图:长图人工裁好再传,系统只负责接收“备案凭证图”和“详情页切片图”;
- 分步实现:先让 OMP 把左中右三栏的基础静态页面和状态搭好,再打通单张切片的审查 Prompt,最后做本地缓存和 Excel 导出;
- 严格约束交付物:右侧严格固定三列内容(违规词拆解、合规建议、规范依据),跟她平时交给业务部门的 Excel 格式一模一样。
整个过程异常顺利,几乎没有卡壳。
能这么顺,核心并不是我的 prompt 写得有多神,而是之前在 Hermes Agent 里被折磨过好几轮,踩坑沉淀出来的 Skill 语料足够丰富。
从 L1/L2/L3 的三层词库、26 种法定功效的判定口诀、到“去屑止痒因果链”、“深入 vs 深层”的边界,甚至 Excel 表头的深绿底色,全都在真实业务里被验证过了。把这些现成的高密度规则直接当成规范喂给 OMP,AI 写出来的逻辑自然非常扎实。
架构上的关键质变:任务池(Pool)
这个小工具做出来叫「逐页审查台」,形态非常简单:
- 左边是切片目录和进度,清清楚楚列着图 1 到图 13 的状态;
- 中间是大图预览,方便肉眼逐页对照;
- 右边是审查面板,直观列出违规拆解、修改建议和法条依据,支持直接手动改两个字;
- 顶部一键导出标准 Excel,也有本地历史任务可以回溯。
但它底层最大的变化,是把原来单 Agent 的串行执行,改成了并发任务池(Pool)。

用户把备案图和十几张切片往里面一扔,系统在后台把每一张切片都拆成一个独立的子任务扔进 Pool 里并发跑。
这个设计带来了两个立竿见影的改变:
- 速度彻底解决:十几张图瞬间多路并发跑完,泡杯咖啡的功夫整套物料就审查完毕;
- 上下文彻底隔离:每一页切片都在干净、独立的单次 Prompt 里对照备案跑判定。没有了长对话的上下文污染和历史包袱,模型不再脑雾,输出质量变得极度稳定。
她现在的工作流完全变了:不再是守着对话框被动等字,而是把素材往工具里一丢,然后像流水线质检员一样,在中间大图和右侧建议之间扫一眼,有需要微调的顺手改一下,确认没问题直接点“下载 Excel”发给业务。
这件事让我对 Harness 的思考
做完这个小工具,我一直在想:我们到底该怎么去给 AI 制定 Harness?
现在市面上有一种很强的惯性,觉得 Agent 就是万能的,恨不断把所有的工作流都塞进一个 Chat 对话框里,让它自主规划、自主调度、长程记忆、自主交付。
但真实用过就会发现,聊天对话框其实是一种非常特殊、且有明确局限性的 Harness:
- 对话框适合做探索:它适合拿来陪伴、聊天、发散思路、或者在业务初期不断试错,把模糊的想法一步步拉扯、提炼成高密度的规则与知识;
- 但对话框极不适合做高吞吐的确定性生产:一旦场景进入高频、批量、规则明确、要求视觉对照和并发交付的阶段,继续把任务硬塞给单 Agent 对话框,只会得到糟糕的效率和飘忽的质量。
这次帮对象做工具的过程,其实是一个很标准的退火过程: 我们在 Hermes 对话框里把业务规则磨得足够透,然后果断从对话框里退出来,用这些磨好的规则,给具体场景量身定制一个最合适它的专用 Harness(网页 + 任务池)。
AI 管不了 AI,能管住 AI 的只有 Harness。工具并不是越庞大、越全能越好,针对具体场景配一个刚好够用、能把不确定性收敛掉的架子,才是最舒服的状态。