「为什么传统技能调用会浪费上下文?」
传统 Raw-Skills 的调用方式比较直接:判断任务需要某个技能后,把完整技能材料交给模型,让模型自己阅读和判断。
这种方式在小规模任务里可行,但在高频调用中会出现三个问题。
第一,很多内容和当前任务无关,却仍然进入模型上下文。我们对代表性任务的原始技能执行日志做过分析,智能体每次平均加载约 17.8K 个源 token,其中约 51.21% 在后续执行轨迹中没有被引用。

第二,同一个技能被反复调用时,模型会重复做相似的理解和规划。很多步骤其实是稳定的,比如读取输入、调用脚本、填充模板、验证输出,但传统方式仍然让模型每次在线重新理解。
第三,越复杂的技能包,越依赖模型在长上下文里抓重点。对于一些本来流程稳定的任务,这会造成不必要的模型调用和成本压力。

「SkillSmith 的核心:先整理边界,再运行时调用」
SkillSmith 的核心思想很简单:不要让智能体每次都从头读完整说明书,而是把技能提前整理成一个边界清晰的接口。
这个接口被称为 Boundary Contract,也就是边界契约。它记录一个技能在运行时可以稳定提供什么能力、需要什么输入、会产生什么输出、有哪些执行限制、如何验证结果,以及在接口不够用时如何回到原始材料。
边界契约的作用类似 API 文档。智能体不需要一开始就读取全部技能包,而是先看到紧凑的技能摘要;当它确认需要使用这个技能时,系统再按需披露相关操作、策略约束和回退材料。

上面这张方法总览图展示了 SkillSmith 的整体流程:左侧是离线编译,把技能包整理成边界契约;右侧是运行时调用,智能体按需选择接口、执行操作、获取指导或回退到原始材料。
「不同技能,用不同方式整理」
现实中的技能包形态差异很大。SkillSmith 不会把所有技能都强行变成同一种固定流程,而是先识别技能的自然形态。
常见形态包括:
工作流型
有明确步骤、依赖关系、检查点和执行顺序。
调度器型
包含多个脚本、函数、命令或可调用操作。
参考型
主要提供规则、表格、模板、示例和领域说明。
信息不足型
暂时无法可靠整理成接口,保留诊断信息并回退到原始材料。
这些技能经过整理后,都会以统一的边界契约暴露给运行时。也就是说,技能原本的结构被保留下来,但智能体看到的是更清楚、更小、更适合调用的接口。
「运行时有三种结果:执行、指导、回退」
SkillSmith 不把整理后的技能包装成一个"包办一切"的黑盒。它更像一个受约束的技能运行层。
当智能体选择一个技能后,运行时会根据边界契约和当前任务判断下一步:

Execute:条件明确、策略允许时,直接执行某个类型化操作或脚本。
Guidance:当前情况需要模型继续判断时,返回相关指导和参考信息。
Fallback:接口覆盖不了需求,或策略不允许直接操作时,回到原始技能材料。
这个设计很重要。真实业务里有很多任务涉及文件格式、外部工具、语义判断、人工偏好或安全策略。系统需要知道自己能做什么、不能做什么,以及什么时候该把控制权交还给智能体。
「核心效果:更少 token、更短时间、更少迭代」
在 7 个代表性任务上,直接使用原始技能包的方式完成任务需要约 1.5M tokens、999 秒和 107 次思考迭代。
使用 SkillSmith 后,同样完成这些任务需要约 620K tokens、494 秒和 61 次思考迭代。
对应变化为:
求解阶段 token 使用量降低 57.44%
求解时间降低 50.57%
思考迭代次数降低 42.99%
token 计量成本同步降低 57.44%

上面的端到端效果图同时展示了 Raw-Skills、SkVM-Compiled Skills 和 SkillSmith 在 token、时间、迭代次数上的对比。可以看到,SkillSmith 的主要收益来自减少运行时反复解释技能所消耗的上下文和推理步骤。
需要强调的是,这不是说所有任务都会固定提升同样比例。SkillSmith 最适合的是那些流程相对稳定、技能材料较多、调用频率较高的任务。
「强模型整理技能,经济模型高频调用」
SkillSmith 还有一个很实用的方向:编译和运行可以分开。
对于重要且高频的技能,可以先用能力更强的模型在离线阶段整理技能边界;到了线上运行时,再交给更经济的模型调用这些接口。这种方式把一部分"理解技能说明书"的成本从在线阶段转移到了离线阶段。它并不意味着小模型可以无条件替代强模型。
更准确地说,强模型可以帮助沉淀技能结构,经济模型可以在清晰接口的帮助下承担更多高频执行工作。跨模型结果展示了这一点:当技能结构被提前整理后,不同运行时模型都可以通过更清晰的接口减少一部分在线解释负担。

「适合哪些应用场景?」
SkillSmith 对用户最直接的价值,是让智能体在重复执行专业任务时更像一个熟练员工:第一次把流程学清楚,之后遇到类似任务就不必每次从头读手册。
01 企业文档和办公流程
合同初筛、offer letter 生成、PPT 格式校验、表格数据处理等任务,通常有固定模板、字段规则和检查步骤。SkillSmith 可以把这些稳定部分整理成接口,减少重复阅读和重复规划。
02 数据处理和科研辅助
一些数据任务需要按固定流程处理文件、调用脚本、检查输出。SkillSmith 可以把稳定操作沉淀下来,把模型预算留给参数选择、结果检查和异常处理。
03 多模型协作和成本控制
在真实业务中,不可能所有步骤都长期使用最强模型。SkillSmith 让强模型更适合承担离线整理工作,让更经济的模型承担高频运行工作。
04 可维护的技能体系
当一个组织积累大量技能包时,最怕的是每个技能都只是一大段说明文档,能力边界、适用条件、风险和回退方式都不清楚。边界契约让技能更接近工程接口,更容易维护、复用和审查。
「边界也要说清楚」
SkillSmith 不是万能的。如果一个技能包本身不完整、过时,或者严重依赖某个特定环境,整理出来的接口也会继承这些问题。若工具版本、文件格式、依赖环境或执行策略发生变化,也需要重新验证或重新整理。
此外,SkillSmith 主要减少的是"反复解释技能"的成本。它不能消除所有任务成本。外部工具运行、文件读写、视频处理、复杂语义判断和人工偏好判断,仍然需要在运行时完成。SkillSmith 让智能体在调用可复用技能时更省、更清楚、更容易控制,而不是让所有任务自动变得简单。
「总结」
智能体真正进入生产环境后,瓶颈不只在模型能力本身,也在于我们如何把知识、工具和流程交给模型使用。
过去,很多技能系统像是把一本完整手册塞给智能体,让它每次自己读、自己想、自己拆步骤。SkillSmith 做的是把手册中稳定、可复用、可执行的部分提前整理成边界清晰的接口,让智能体在运行时少读无关内容,把更多预算用在真正需要判断的地方。
让智能体成为生产力工具,不能只靠更大的模型,也需要更好的技能组织方式。