新闻动态

你的位置:波音体育平台 > 新闻动态 >

Vibe一下能自动画工程图、做3D装配的AI来了

发布日期:2026-07-13 00:19    点击次数:157

当大模型开始"使用电脑",我们似乎离真正的 AI 自动化又近了一步。

过去一年,从浏览器操作、表格填写,到办公软件自动执行任务,Computer-Use Agent 正在成为大模型落地的重要方向。

但一旦进入真正的专业软件,这条路线很快遇到了瓶颈。

比如,让 Agent 在 SolidWorks 中完成 3D 建模与装配,在 AutoCAD 里绘制一张带尺寸标注的工程图,或者在 Photoshop、Premiere 里完成一套完整的修图、剪辑流程等,这些专业人员的日常工作,现有的 Computer-use agent 仍难稳定完成。

原因很简单:一方面,专业软件的界面远比日常软件更加复杂、密集,对 Agent 的视觉感知与定位能力提出了更高要求;另一方面,专业级任务往往不是几步点击就能完成,而是包含数十甚至上百个连续操作。一次微小的交互偏差,可能会在长链路中不断累积,最终影响整个任务结果。

近日,上海 AI Lab 等团队提出了一种面向专业软件智能体的新范式——ComAct(COM-as-Action)。

它的核心思想在于:不再把鼠标点击和键盘输入作为 Agent 的 action,而是让 Agent 直接生成 COM 代码,通过软件底层对象模型操纵真实专业软件。

专业软件 Agent 的核心瓶颈:不是不会规划,而是操作方式太脆弱

当前 GUI Agent 存在显著短板。以 CAD 软件为例,一个完整任务可能包括创建草图、设置约束、拉伸实体、编辑特征、装配零件、检查干涉、生成工程图、导出文件等多个阶段。每个阶段都涉及大量细粒度操作,而且强依赖前一步结果。

在这样的场景里,Agent 不仅要理解任务,还要持续完成高精度视觉定位和低层交互。一旦选错工具、点错对象、输入错参数,后续步骤就可能全部偏离。

另一条路线是 API/MCP-based Agent。它通过结构化接口调用完成任务,执行更稳定。但在真实专业软件中,公开 API 往往并不完整,不同软件之间接口差异巨大,很多商业软件也并不具有开源的 API。

因此,专业软件 Agent 面临的并不是简单的"模型不够聪明",而是 GUI 作为 action space 还不够适合这些任务,具体原因是:

GUI 操作鼠标和键盘足够通用,但长程任务中容易受视觉定位误差影响;直接调用软件 API 更稳定,但常常受限于商用专业接口碎片化和功能覆盖不足,很难在工业软件中使用。

ComAct 试图从另一个角度切入:既然很多重型桌面软件本身就暴露了系统级对象接口,为什么不让 Agent 直接使用这些接口?

△GUI as Action 依赖视觉定位,API/MCP as Action 面临接口碎片化,而 COM as Action 将专业软件操作转化为统一的代码执行。COM:让 Agent 用"软件自己的语言"操作软件

COM,全称 Component Object Model,是 Windows 生态中长期存在的一套组件对象模型标准。

大多数传统、重型专业软件都通过 COM 暴露内部对象和功能。

对于 Agent 来说,COM更接近软件内部语义。Agent 不再需要在屏幕上寻找按钮,而是可以直接操作软件对象,例如 CAD 中的草图、零件、装配体,或 Office 中的文档、表格、幻灯片。其二,COM提供了更确定的执行方式。相比连续 GUI 点击,COM 代码一旦生成正确,就可以直接调用软件功能,减少长程操作中的视觉定位误差累积。其三,COM具备跨软件扩展潜力。Office、Adobe、Autodesk、SolidWorks 等大量 Windows 专业软件都不同程度支持 COM,这为跨软件工作流提供了统一入口。

也就是说,ComAct 把专业软件操作从:

看屏幕→找按钮→点鼠标

变成了:

理解任务→生成代码→执行软件对象操作

这正好匹配大模型最强的能力之一:代码生成。

在 ComAct 中,Agent 每一步会看到当前软件截图和上一轮代码执行后的 terminal 输出。如果代码报错,它可以根据 traceback 修复;如果任务还没完成,它继续生成新的 COM 脚本;如果最终结果满足要求,它输出 DONE。

这使得 Agent 不再是一个低层 GUI 操作者,而更像一个会写自动化脚本的工程师。

ComCADBench:让 Agent 真正进入 CAD 工程现场

为了验证这一范式,研究团队构建了ComCADBench,一个面向真实 CAD 软件操纵的 benchmark。

△ComCADBench 覆盖 3 个 CAD 平台、7 类工程活动,并支持长程多任务工作流。

它覆盖三款主流 CAD 软件:SolidWorks、Inventor、AutoCAD,以及七类核心工程任务:2D 草图、3D 建模、编辑、装配、工程图生成、质量属性分析和干涉检查。整个 benchmark 包含 400 条单任务与 600 条多任务流程,模拟真实工程场景中常见的任务组合,比如建模后分析物理属性、装配后做干涉检查等。ComCADBench 直接基于最终 CAD artifact 进行评价,也更接近真实工程任务的评估方式。

ComForge:面向真实专业软件的大规模并行训练平台

真正训练一个能稳定操纵专业软件的 Agent,需要让它在大量真实环境中反复试错、获得反馈。为此,团队搭建了 ComForge。每个环境都是一个容器化的 Windows 虚拟机,内部预装 SolidWorks、Inventor、AutoCAD 等软件,Agent 生成的代码会在其中真实执行,软件会真实返回截图和报错信息。一个异步调度器负责把任务分发到空闲的虚拟机上,让成百上千个环境同时跑起来,从而支持大规模评测与强化训练。

基于 ComForge,团队训练出了智能体 ComActor,通过结合监督微调与强化学习的训练流程,让模型从"能写出语法正确的 COM 代码"逐步进化到"能根据报错自我修正",并进一步对齐最终 CAD 产物的工程要求。

△ComAct 主框架。包括数据构建、ComActor 闭环执行,以及 ComForge 并行真实软件环境。GUI Agent 受限,COM 范式打开新局面

在 ComCADBench 真实 CAD 长程任务中,当前 GUI Agent 的表现非常有限。复杂界面、精细定位和多步骤依赖,使得 GUI Agent 几乎全线 0 分。但当 action space 从 GUI 切换到 COM 后,同样的模型在零样本设置下就能拿到非零、甚至可观的成功率。这说明大模型本身具备完成这些任务所需的推理能力,只是被传统 GUI 交互方式限制住了。

最终,训练后的 ComActor 在 ComCADBench 上全面匹敌 GPT-5、Claude-Sonnet-4.6 等参数量更大的模型,在需要多步骤接力完成的长流程任务上优势尤为明显;在两个外部通用 CAD 基准上,也展现出了不错的泛化能力。

写在最后

这项工作提供了一个值得关注的思路:当 GUI 操作太脆弱、专业软件又没有公开 API 时,COM 这类系统级原生接口,可能是 AI 操纵专业软件更现实的一条路。论文也指出了当前局限——目前的验证仍局限于 CAD 领域和 Windows 平台,商用软件授权等现实问题也有待解决。但考虑到 Office、Adobe 等大量专业软件同样原生支持 COM,这一范式具备向更广泛场景迁移的潜力。

论文链接:https://arxiv.org/abs/2606.13239

项目主页:https://KnowledgeXLab.github.io/ComAct

第一作者:Jiaxin Ai ( Shanghai AI Lab/ 武汉大学 )

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。

� �   我们会 ( 尽量 ) 及时回复你 : )

� � 点亮星标 � �

科技前沿进展每日见