【AI原生】优化Agent和Skill工程的一些技巧

先前的文章里,笔者聊了怎么用AI-Native的方式编写一个告警诊断Agent和Skill,那篇更多是单点视角,怎么把一个Agent做好的问题。这篇文章接续上篇的内容,从一个更加完备的工程角度,简单聊一下怎么把Agent和Skill跟自己日常做的工作做更深度的集成,让人退到工程后面去,而不是把AI当做一个外挂的提效工具。

首先是第一条原则,深度放权,核心就是承认模型的智商比自己高,而且不是高一点半点。不管知识面、编码熟练度还是干活性价比,人跟模型比哪哪都差。所以能让Agent做的事情,尽量让Agent生成,Agent做不了的,才由人来做。

这个说起来简单,实操中却很反直觉。常见的做法是,有了Agent之后还是不放心,在上面添加各种Workflow、编排、校验节点之类人为的东西,把Agent框得死死的,结果能力施展不开,最后效果不好,反而得出”AI不行”的结论。

举个例子,去年年底笔者在做知识库重构攻坚,6个人花20天把一个企业级的知识库重构完。如果现在用模型来做,估计一个人两周就能搞定。这中间的差距说白了就是放权程度,前者还是人在主导,AI打下手,后者是AI来主导,人只管验收和把关,两种方式出来的效率肯定不是一个量级的。

那人的核心优势在哪里?多数人的第一反应是懂业务,但并不是。智商高的模型,稍微熟悉下业务就可以把你代替掉。人的核心优势,是能做最兼顾现实和理性的判断。AI更多是理性而非现实,它给出的方案单从技术上看是没毛病的,但落地的时候有很多东西是技术覆盖不到的,比如人力够不够、上下游排期能不能配合、存量的历史包袱敢不敢动、变更窗口允不允许,这些约束下,有时候看起来次一点的方案反而是能落地的。所以充分放权的同时还是要做harness,本质上就是为了满足各类人的需求,让AI舍弃一些理性,让结果更回归现实。

其次是怎么判断哪些事情要由人来做,也就是古法编程的适用边界,笔者的判断标准是两块:

  • 涉及私域知识、业务SOP,需要由人介入把控的事情,由人来做。倒不是模型学不会这些知识,而是这类事情怎么判断,要贴着现实来,组织的共识、业务的权衡这些东西,不是纯靠理性推导出来的。
  • 有执行效率要求的事情,比如千万级数据的处理、高频的批量任务,交给Agent写程序来做。模型直接推理一轮的成本跟时延,比起跑一段代码没有优势。

值得一提的是,当前工作里最常见的形态,并不是所有情况都Agentic执行,而是在古法编程的工程基础上,对特定的一些业务场景做AI驱动。这个形态是非常合理的,因为就算让AI来搞,AI也必然会自己写一堆代码,先构建一些基础工程,然后再在上面继续做事。所以为什么AI模型用在Coding场景最多,因为就算让AI搭建一套虚拟业务,它也会认为需要Coding的场景最多。

除去这两块之外的事情,都建议交给Agent。当然有一个前提,私域知识虽然由人把控,但把控的方式不是每件事都人工盯着,而是把知识沉淀成Agent可消费的形态。这里要强调一点,要把Agent做大规模的工程化,底座的知识库也要做大规模的工程化,这个非常重要。只把Agent工程化拉起来,知识供给还停留在零散文档的阶段,那规模化落地大概率是做不起来的。

然后是知识预热。在执行效率有SLA的前提下,能不能快速精准拿到需要的知识,对Agent的效果提升非常重要。比起纯RAG或者把Reference堆在Prompt里,更好的做法是把Provider(KBase)和Consumer(Agent)这个关系做好,整体分三层:第一层,Agent在运行前主动去Claim自己需要的知识,声明清楚这个Skill需要哪些知识、什么版本;第二层,KBase针对特定版本的Agent做预热,把Claim到的知识提前准备好,注入到Agent的运行上下文里;第三层,实在hit不到的,才fallback到RAG兜底。

这套机制的好处是,知识消费从被动检索变成了主动声明,给什么知识、什么版本、什么时机注入,都是可控的,而不是像纯RAG那样,每次靠向量相似度赌一把召回质量。RAG就作为兜底,不作为第一选择,这样才能充分发挥私域知识库的优势。

再往后是定制化模型。知识预热做的事情,本质上是把知识放在模型外面,用工程手段喂给模型,那能不能直接把知识放进模型里面呢?答案是可以的,就是用冗余的知识对模型做进一步训练。这里说的冗余知识,是知识库里使用频率高、跟业务场景强绑定的内容,拿去做SFT或者继续预训练,让模型一开始就懂这部分东西,实战场景里的输出也会更加准确。当然定制化模型成本不低,建议先把预热机制跑顺,沉淀出哪些知识是高频消费的,再针对性做定制化训练,循序渐进。

最后想多说几句,给古法编程比较有经验的老手们:根本无需担忧。你对于技术演进的判断,就是让Agent/Skill发挥最大潜能的钥匙。你懂技术,AI自然知道你想要什么;对技术一知半解的话,AI就只会在你的上限游走,你想不到的东西,模型也发挥不出来。所以与其焦虑被替代,不如想想,老手对技术演进的判断力,在AI时代,难道不是最为稀缺的harness么?

总体来看,Agent和Skill跟工作的深度集成,核心还是处理好人和模型的分工,模型负责执行,人负责做兼顾现实和理性的判断,用harness让结果回归现实。知识层面则从被动RAG走向Provider/Consumer的预热,再进一步走到定制化模型。

最后再简单强调一下,这篇文章本身,也是笔者第一次极度充分借助Agent来写的,从提纲到行文都是跟Agent来回打磨出来的,也算是文中观点的一次实践了。充分放权,但把握住核心的判断,这便是Agent的Harness之道。

版权声明
本文为博客HiKariのTechLab原创文章,转载请标明出处,谢谢~~~