>_CLI-Anything 洞察报告
研究报告 · 2026资料截至 2026.07.22

Agent-native software research

CLI-Anything 研究报告
及对企业软件的参考

当 Agent 成为软件的新用户,真正需要重做的不是界面,而是能力边界、动作契约与治理方式。

INTERFACE SHIFT
Human interfaceGUI
视觉理解 · 坐标点击 · 等待状态
重新封装
Agent interfaceCLI + JSON$ crm opportunity update --id 2048 --stage won --dry-run显式动作 · 结构化状态 · 确定性反馈
本报告核心判断CLI 是载体,真正的资产是可治理的业务动作层。
45.7kGitHub Stars¹
4.3kForks¹
2,280+官方宣称通过测试
18专业软件示例口径
v0.4.0截至统计日最新发布

¹ GitHub 页面读取值会随时间变化;以上为 2026-07-22 核验快照。

01 · EXECUTIVE SUMMARY

执行摘要:值得关注,但不宜神化

CLI-Anything 把一个已存在多年的工程常识变成了 Agent 时代的产品主张:机器不该被迫模仿人点击界面,而应直接获得结构化、可组合、可验证的软件能力。

核心结论

它不是“GUI 的终结者”,而是企业软件动作层的一次重新发现。

项目价值最高的部分,是把源码分析、命令设计、状态模型、JSON 输出、原生后端调用、测试与 Skill 文档串成统一 SOP。它让软件“可被 Agent 使用”从零散接口开发,变成一项可以规模化运营的产品能力。

战略价值 生产成熟度 中低企业试点建议 积极
01

接口设计重心迁移

页面不再是唯一入口;对象、动作、状态与错误反馈成为 Agent 体验。

02

CLI 是最薄执行层

它复用 shell、权限与脚本生态,也可继续被 MCP 和 Skill 包装。

03

闭源系统不能照搬

缺少源码和稳定后端时,自动生成质量会明显下降。

04

测试口径仍需补课

单测数量不等同业务任务成功率,企业必须建立自己的 eval。

05

最佳形态是混合架构

API/CLI 处理主路径,浏览器与 RPA 覆盖长尾,人类负责高风险确认。

06

CRM 是天然试验田

对象清晰、动作丰富、结果可回读,适合验证完整闭环。

02 · BACKGROUND & TIMELINE

从工具生成器,快速长成 CLI 生态

CLI-Anything 由香港大学数据智能实验室(HKUDS)团队推动。项目在 2026 年上半年快速完成从 harness 生成方法、跨 Agent 适配,到 CLI-Hub 与技术报告的扩张。

01

Codex Skill 接入

从 Claude Code 插件走向多 Agent 平台。

02

Skill 与 CLI-Hub 成形

生成 CLI 同步产出 SKILL.md;Hub 支持 Agent 自主发现与安装。

03

v0.2.0

七阶段方法与渐进披露文档重构,工程 SOP 更清晰。

04

包管理器与 v0.3.0

支持 pip/npm/brew 等来源,生态从“自建 harness”扩展到公共 CLI。

05

技术报告发布

正式提出 Agent-native computer use 范式。

06

v0.4.0

引入 CLI Matrix,集中修复 17 类问题并完成 4 项安全加固。

07

研究截点

仓库约 45.7k stars;任务完成率 benchmark 仍在路线图。

THE 7-PHASE PIPELINE

七阶段的关键,不是“生成代码”,而是把交付标准一并生成。

官方流程依次覆盖 Analyze、Design、Implement、Plan Tests、Write Tests、Document 与 Publish,并可通过 refine 反复做能力差距分析。

阅读 HARNESS.md ↗
  1. 1分析源码与后端
  2. 2设计命令与状态
  3. 3实现 CLI / REPL
  4. 4规划测试
  5. 5编写单测与 E2E
  6. 6记录结果与 Skill
  7. 7安装并发布

03 · USE CASES

哪些场景最适合 CLI-Anything

优先选择具有稳定后端、可验证输出和批量操作价值的软件。越依赖视觉创作细节、实时交互或专有前端状态,封装难度越高。

01办公生产力

文档与演示交付

Agent 调用 LibreOffice 等真实后端,创建、修改并导出 PDF;适合批量报告、模板套用和格式校验。

适配度 治理风险
02创意工具

图像、3D 与视频制作

通过 GIMP、Blender、Shotcut、Kdenlive 等 harness 操作工程文件并调用原生渲染器。

适配度 治理风险
03数据与科研

数据清洗、CAD 与 GIS

把 OpenRefine、FreeCAD、QGIS 等专业能力封装为可重复命令,支持批量运行与结果验证。

适配度 治理风险
04开发与运维

测试、调试与基础设施

用于 WireMock、RenderDoc、LLDB、日志分析、对象存储和工作流系统的结构化操作。

适配度 治理风险
05企业应用

存量 SaaS/API 统一封装

把分散 API 和 SDK 组织成状态化命令组,减少 Agent 面对大量细粒度工具的认知负担。

适配度 治理风险
06协作

会议与知识管理

围绕 Zoom、Joplin、Obsidian、Zotero 等完成检索、整理、导出与有限写入。

适配度 治理风险
快速判断公式稳定底层接口+明确业务对象+可自动验证输出强视觉依赖= 优先级

04 · COMPETITIVE LANDSCAPE

它的竞品不是一个项目,而是四条路线

CLI-Anything 同时与 MCP、GUI Agent、浏览器自动化和传统 RPA 相邻。它们解决的问题不同,企业应按动作风险、系统可改造性与执行频率进行组合。

路线 / 产品实现方式优势限制适合位置
结构化接口CLI-Anything自动/半自动生成 agent-native CLI 与 Skill轻量、可组合、可测试;适合源码和真实后端依赖源码与强模型;跨软件任务基准尚缺能力执行层
结构化接口MCP 生态以 JSON-RPC 暴露工具、资源和提示跨客户端标准化发现、连接与授权每个服务仍需设计与维护;工具 schema 可能膨胀连接协议层
浏览器/GUIPlaywright CLI / MCP基于浏览器 DOM、可访问性树和脚本执行Web 场景成熟,兼顾 CLI 的 token 效率与 MCP 的状态交互局限浏览器;页面变化仍会造成维护成本Web 执行层
浏览器/GUIComputer Use / GUI Agent截图理解、鼠标键盘与视觉定位无需目标系统改造,覆盖长尾桌面软件速度、成本、稳定性和审计性弱于结构化接口长尾兜底层
企业自动化UiPath / RPA机器人、工作流、API 与人机协同编排治理、编排、审批、运维与企业交付成熟建设与维护成本高;流程变化需持续运营流程编排层
开发者 AgentClaude Code / Codex / Gemini CLIAgent 在终端中读写代码并调用现有命令推理与工程执行能力强,天然消费 CLI本身不等于目标软件的能力封装标准Agent 运行层

本报告判断:CLI-Anything 与 MCP 最适合形成上下层关系,而非替代关系。CLI 提供可测试的本地执行原语,MCP 提供跨客户端的连接、发现与协议约束。

05 · ENTERPRISE REFERENCE

存量企业软件如何改造成 Agent 可用系统

不要从“让 Agent 点现有页面”开始,也不要让 Agent 直连数据库。先建立受治理的业务动作层,再决定它以 CLI、MCP 还是 API 的形式暴露。

01 · 意图层企业 Agent理解目标、规划任务、请求确认
02 · 语义层Skills / Ontology业务对象、规则、动作说明与禁区
03 · 治理入口Tool Gateway鉴权、审批、限流、策略、审计
结构化调用:MCP / function tools / internal API
04 · 动作层Agent-native CLIJSON schema · dry-run · 幂等键 · 回读
05 · 领域层Domain Services客户、合同、配置、报价、工单
06 · 记录层CRM / ERP / PLM继续作为 System of Record
原则 01

复用领域服务,不复制业务逻辑

金额、资格、库存、折扣、权限等逻辑继续由确定性服务负责;CLI 只做契约化入口。

原则 02

读写命令分级

查询默认开放;建议与计划可自动;写入、外发、支付、审批等动作按风险设置确认。

原则 03

每次执行都可解释、可回放

记录操作者、输入、策略版本、命令、结果、异常与写回对象,形成完整轨迹。

原则 04

结果必须由系统回读验证

进程退出码为 0 不代表业务成功;还要读取对象新状态、产物结构与规则校验结果。

企业级补强清单

SSO / 短期凭证与最小权限命令白名单与参数 schemadry-run、幂等键与事务边界高风险动作双重确认敏感字段脱敏与日志分级错误码、重试与补偿机制版本兼容与回归测试任务成功率与越权 eval

06 · INSIGHT DATABASE

可筛选观点数据库

将项目事实、架构判断、风险与组织建议拆开查看。点击卡片可展开判断依据。

真正值得企业借鉴的不是“给每个系统补一个命令行”,而是把业务能力重新整理为机器可发现、可组合、可验证的动作单元。CLI 只是当前最轻量的一种承载形式。

Agent-native交互范式企业软件
依据:技术报告

07 · 90-DAY ACTION PLAN

90 天组织行动路线

目标不是三个月内改造所有系统,而是证明一套可复制的“能力盘点—封装—治理—评测—运营”机制。

DAY 01—30看清能力与风险

建立动作地图

  • 选 1 个主系统、2 个高频场景
  • 盘点 API、服务、批任务与隐藏规则
  • 把动作分成读 / 建议 / 写 / 外发四级
  • 建立 30—50 条真实任务基线
交付物:能力清单、风险分级、评测集
DAY 61—90验证业务闭环

从 Demo 走向运营

  • 灰度给 10—30 名真实用户
  • 跟踪成功率、节省时长与接管率
  • 按 bad case 扩充命令和评测
  • 形成第二个系统的复制模板
交付物:试点复盘、SOP、扩展决策
建议验收指标≥85%低风险任务成功率100%写操作可审计0越权与不可逆事故≥30%人工时长下降≤10%非预期人工接管

08 · CRM AI SPECIAL

针对 CRM AI 产品组织的专项建议

CRM AI 产品不应与销售、营销、CPQ 等产品争夺页面和存量功能,而应建设跨域的 Agent 动作标准、评测体系与试验田。

POSITIONING

把 CRM AI 产品定位为
“客户经营动作层 + Agent 试验田”

业务产品继续拥有流程与记录系统;CRM AI 产品负责把客户经营相关能力整理为 Agent 可用动作,验证新交互并沉淀可复制的 Skill、治理与评测方法。

读 · 默认自动

客户事实与状态

客户 360、联系人、商机阶段、合同与报价状态、历史互动、产品安装量。

crm customer get --id C1024 --json
判 · 有依据输出

风险与下一步建议

商机停滞、赢单概率、合同风险、跟进优先级、配置缺口;返回依据与置信度。

crm opportunity assess --id O2048
做 · 按风险确认

创建、更新与触发

生成待办、补齐字段、发起报价/审批、写回纪要;金额与外发动作必须确认。

crm task create --dry-run --for C1024
01

从自有场景做标杆

优先选择招标书解读、合同风险、产品配置等已有资产,避免先做跨组织重构。

02

把已有 API 变成动作契约

补齐统一命名、schema、错误码、状态回读和权限,不重复建设解析与规则引擎。

03

让 Skill 承载方法,让 CLI 承载执行

例如标书解读 Skill 决定切片、证据与复核流程;CLI 负责调用解析、抽取和写回。

04

建立跨 Agent 的产品指标

不要只看调用量;重点看任务成功率、业务结果、人工接管、错误恢复和单位任务成本。

建议首批 6 个动作

1客户/商机上下文聚合2标书解析与字段抽取3合同风险检查4产品配置建议5创建跟进任务6受控写回业务状态

10 · SOURCES & METHODOLOGY

完整资料来源与研究边界

优先使用官方仓库、技术报告、规范和产品文档。项目口径与本报告判断分开表述;动态数据均标注统计日期。