推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

OpenAI企业报告:同样用AI,领先企业已经把差距拉到8.3倍

   日期:2026-08-24 11:19:07     来源:网络整理    作者:本站编辑    评论:0    
OpenAI企业报告:同样用AI,领先企业已经把差距拉到8.3倍

办公室里的 AI 使用,曾经很容易被概括为几件事:润色邮件、总结会议、查询资料、生成一版文案。

这些任务确实节省时间,却没有改变工作的基本结构。员工仍要自己搜集上下文、切换系统、执行操作,再把结果整理成可交付成果。AI 只是其中一个问答窗口。

OpenAI 在 2026 年 8 月 12 日发布的企业研究,记录了另一条正在加速的路径:企业开始把多步骤任务交给 ChatGPT Work、Codex 一类 Agent,让它读取资料、调用工具、创建文件,并产出可供人工复核的结果。

报告把这轮变化概括为 “从辅助走向执行”

更值得关注的是企业之间迅速拉开的差距。截至 2026 年 6 月,OpenAI 定义的“前沿企业”每位活跃用户生成的输出 token,是典型企业的 8.3 倍;2026 年 1 月,这一差距还是 2.6 倍。

同样接入 AI,使用深度正在变得很不一样。

一、64%:企业 AI 的重心开始移动

OpenAI 此次同时发布了两项互补研究:一项观察企业客户如何使用 Agent,另一项分析 ChatGPT 在不同企业、岗位和职级中的扩散。前者覆盖超过 1000 万条消息,试图回答一个关键问题:企业究竟把 AI 用到了多深?

最醒目的指标来自 Codex。

截至 6 月,在企业客户的 Codex 与 ChatGPT 合计输出 token 中,Codex 占到 64%。这说明企业 AI 的输出规模正在明显转向更长、更复杂的代理任务。

这个数字需要谨慎理解。64% 指输出 token 占比,不能直接等同于 64% 的员工都在使用 Codex,也不能推出 64% 的企业任务已经由 Agent 完成。Agent 往往要处理更长的上下文、执行更多步骤,本身就会产生更多输出。

但它仍然释放出一个清晰信号:企业对 AI 的要求正在从“给出建议”延伸到“完成一段工作”。

例如,过去的典型提问是:“如何准备一份竞品分析演示文稿?”AI 返回框架、步骤和注意事项,后续仍由人来执行。进入 Agent 工作流后,任务会变成:“从这些内部材料与外部信息中整理竞品变化,形成演示文稿初稿,并标注信息来源。”

两种交互都建立在大模型能力之上,却对应不同的价值链:前者主要压缩信息处理和思考时间,后者开始缩短从任务提出到交付的完整链路。

这也解释了为什么 Agent 的企业价值不能只看回答是否流畅。进入生产环境后,评价维度至少还包括:任务完成率、调用工具的准确性、权限是否合规、结果能否追溯、人工复核成本,以及工作流能否被其他员工复用。

聊天体验只是入口,稳定完成任务才是落地阶段的核心指标。

二、8.3 倍差距,来源不只在模型

OpenAI 按“每位活跃用户的输出 token”对企业客户进行月度排序,将前 10% 定义为前沿企业,将第 45—55 百分位定义为典型企业。

2026 年 1 月,前沿企业的这一指标是典型企业的 2.6 倍;到 6 月,差距扩大至 8.3 倍,约为年初的 3.2 倍。报告还指出,这种分化横跨行业和企业规模,并不限于科技公司。

输出 token 并不等于业务价值,无法直接证明前沿企业获得了 8.3 倍的生产率。它更接近“使用深度”的代理指标:员工是否只做零散问答,还是把更长的任务链交给 AI。

前沿企业的差异,在高级能力使用率上表现得更加具体:

  • 每周活跃用户中,21% 使用 Plugins,典型企业为 9%
  • 19%
     使用 skills,典型企业只有 3%
  • OpenAI 内部每周使用 Plugins 的活跃用户比例达到 95%,可视为高强度采用的参照案例。

按照 OpenAI 的定义,Plugins 是为特定工作流打包的一组能力:其中,skills 提供可复用的任务指令,apps 负责连接企业数据、工具和具体操作。以销售场景为例,一个 Plugin 可以组合团队销售手册与 CRM 访问能力,再结合历史方案和最新客户信息生成定制回复,最后交给员工确认。

模型在这个过程中负责理解与推理,企业上下文决定它掌握什么,工具决定它能做什么,skill 则把有效的任务方法变成可重复执行的路径。

这构成了报告最有价值的一层判断:模型访问只是起点,企业能否把上下文、工具和流程组织起来,正在决定 AI 的使用深度。即使获得相近的模型访问权限,不同企业也可能走向完全不同的采用结果。

三、Agent 从写代码扩散到整个知识工作链

软件工程是 Agent 较早形成规模化采用的场景。代码有明确语法、可测试结果和版本控制,天然适合“执行—验证—修正”的循环。

OpenAI 的企业数据表明,扩散速度最快的岗位已经出现在工程部门之外。自 2026 年 2 月以来,企业 Codex 周活跃用户的增长倍数分别为:

  • 法律:108 倍
  • 销售:41 倍
  • 招聘:41 倍
  • 市场:26 倍
  • 工程:5 倍

这组数字同样不能直接当作岗位渗透率。法律部门的 108 倍很可能包含低基数效应;工程部门只增长 5 倍,也可能因为它原本就有较高使用量。报告没有在摘要页给出各职能的绝对用户规模,因此更稳妥的结论是:Codex 式 Agent 的使用边界正在快速越过软件开发,进入大量由文档、数据和流程组成的知识工作。

这些适合 Agent 承接的任务存在一个共同结构:输入分散在多处,执行需要若干步骤,最终产物可以由人检查。

法律人员可以让 Agent 搜集条款、对照模板并生成审阅清单;招聘团队可以基于职位要求整理候选人材料;市场团队可以汇总研究并形成内容初稿;销售团队可以结合 CRM 和历史方案准备客户回复。

Virgin Atlantic 的案例提供了更直观的尺度。其工程团队使用 Codex,将一项遗留代码重构从两周缩短到 30 分钟;产品团队则使用 ChatGPT Work,把原本需要数周的竞品研究压缩至数小时,用于支持公司的五年数字战略。

单一案例无法代表所有企业都能取得相同比例的提效,但它展示了 Agent 适合承接的任务形态:范围明确、资料可访问、过程可拆解、结果可复核。

四、企业落地需要一套“执行环境”

从辅助问答走到可执行工作流,企业需要建设的能力也随之变化。一个可用的企业 Agent,至少需要五层条件。

第一层:清晰的任务与验收标准。

“帮忙研究市场”过于宽泛;“基于指定来源比较三家竞品,输出包含引用、风险项和待确认问题的十页初稿”更适合交给 Agent。任务边界越明确,结果越容易验证。

第二层:可访问的企业上下文。

仅靠通用模型,Agent 无法自动掌握某家公司的最新客户状态、内部规范、历史决策和项目约束。连接知识库、CRM、代码仓库与业务系统,决定了它能否从通用回答进入真实工作。

第三层:受控的工具权限。

读取文档与修改生产数据的风险完全不同。企业需要按任务配置最小权限,对高风险操作设置审批,并保留调用记录。Agent 的执行力越强,权限设计越重要。

第四层:人工复核与异常处理。

报告强调了清晰权限、治理与人工审查。适合自动执行的环节可以逐步放开;涉及法律责任、资金、客户承诺或不可逆操作时,人工应保留最终决定权。

第五层:把个人技巧沉淀为共享工作流。

一个员工偶然写出好提示词,价值仍停留在个人层面。把任务说明和验收规则沉淀为 skill,再根据需要通过 Plugin 连接数据与工具,成功做法才有机会跨团队复制并持续迭代。

因此,企业 Agent 项目的建设对象可以用一个简化公式表达:

可执行工作流 = 模型能力 × 企业上下文 × 工具权限 × 复核机制 × 组织复用

任何一项接近零,整体效果都会明显受限。只采购账号而缺少流程改造,员工容易停留在问答和文案生成阶段;只追求自动化而忽略权限与复核,又会放大操作风险。

五、一个容易被忽视的变量:职业早期员工用得更多

关于企业 AI,常见调查往往显示管理者和高管使用更积极。OpenAI 基于数百万次对话的实际使用记录得到相反结果:企业采用六个月后,职业早期员工每周比高管多发送 13 条消息

这个发现不宜简单解释为“年轻人更懂 AI”。岗位任务结构、使用频率、审批权限和管理者工作方式,都可能影响消息数量。它至少说明,有价值的 AI 工作流线索未必首先出现在组织架构的最高层。

许多职业早期岗位包含大量具体的信息处理与系统操作,因此更容易暴露出适合交给 Agent 的环节。这些员工可能已经形成有效做法,却缺少将其标准化和扩散的渠道。

对管理者而言,一项低成本动作是识别组织内部的高频使用者:他们把哪些任务交给 AI,调用了哪些数据和工具,在哪些节点保留人工确认,结果如何衡量。经过验证的个人工作流,可以进一步封装为团队模板。

这比统一发放一套提示词更接近组织学习。组织需要传播的是完成工作的结构,而非一句孤立的 prompt。

六、企业落地可以从三类任务开始

报告呈现的路径可以转化成一个实用的选型框架。首批 Agent 工作流优先考虑三类任务:

  1. 高频且耗时
    :每周反复发生,节省时间能够持续累积;
  2. 输入可访问
    :所需数据已经数字化,并能在权限范围内连接;
  3. 结果可验证
    :存在明确模板、测试、清单或人工审批标准。

可以先选择一条窄流程,例如“汇总客户背景并生成会前简报”,记录任务完成时间、返工率、人工介入点和错误类型。验证稳定后,再扩大数据范围和操作权限。

企业还需要同步观察三组指标:

  • 采用指标
    :周活跃用户、重复使用率、进入工作流的任务数量;
  • 质量指标
    :一次通过率、返工率、事实错误和异常调用;
  • 业务指标
    :交付周期、人工耗时、成本、收入或客户体验变化。

输出 token 可以反映使用深度,却不应成为最终目标。企业需要把“AI 用得多”继续追踪到“任务完成得更快、更稳、更可控”。

结语

OpenAI 的报告记录了一个明确拐点:企业 AI 正在离开单一聊天框,进入由上下文、工具、权限和复核共同组成的执行链路。

64% 的 Codex 输出 token 占比,显示复杂代理任务已经占据显著的输出规模;8.3 倍的使用深度差距,则提醒企业,AI 普及不会自然消除组织差异。能够率先把个人经验固化成共享工作流的企业,会更快积累数据连接、治理规则和使用习惯。

下一阶段的竞争重点已经逐渐清晰:找到值得交给 Agent 的任务,给它恰当的上下文与工具,在风险边界内完成执行,再由人负责判断、审批与持续改进。

当这套闭环开始运转,AI 才会从一个随时可问的助手,变成组织中可重复调用的工作能力。


来源说明: 本文数据与案例均来自 OpenAI 于 2026 年 8 月 12 日发布的官方文章 From assistance to execution: How enterprises put AI to work 

欢迎关注 AI觉醒观测者,持续追踪 LLM 与 Agent 前沿动态。

 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008326号-18
Powered By DESTOON