
Netomi 分享了其基于 OpenAI GPT-4.1 和 GPT-5.2 构建企业级 AI Agent 系统的宝贵经验,包括为真实世界复杂性设计、并行处理以满足延迟要求、以及将治理融入运行时等关键实践。
2026年1月8日,Netomi 分享了其基于 OpenAI GPT-4.1 和 GPT-5.2 构建的企业级 AI Agent 系统规模化部署的宝贵经验。企业期望 AI 智能体能够可靠地处理混乱的工作流,默认遵守政策,在高负载下稳定运行,并清晰展示其工作过程。Netomi 的系统满足了这些高标准,服务于联合航空(United Airlines)和 DraftKings 等《财富》500 强客户。其平台将低延迟、可靠工具调用的 GPT-4.1 与用于更深层次、多步骤规划的 GPT-5.2 相结合,并在一个受控的执行层内运行,旨在确保在真实生产条件下模型驱动的行为是可预测的。 运行如此规模的 Agent 系统,使 Netomi 总结出了一套企业内部成功部署此类系统的蓝图。正如其 CEO Puneet Mehta 所言:“我们的目标是编排人类客服通常需要同时处理的众多系统,并以机器的速度安全地完成。”
单个企业请求很少对应一个单一的 API。真实的工作流跨越预订引擎、忠诚度数据库、CRM 系统、策略逻辑、支付系统和知识库。数据通常不完整、相互矛盾或具有时效性。依赖脆弱流程的系统在这种多变性下会崩溃。 Netomi 设计了其 Agentic OS,让 OpenAI 模型位于一个为这种模糊性而构建的受控编排管道的核心。该平台使用 GPT-4.1 进行快速、可靠的推理和工具调用(这对实时工作流至关重要),并在需要多步骤规划或更深层次推理时使用 GPT-5.2。 为了确保代理在长期、复杂的任务中保持行为一致,Netomi 遵循 OpenAI 推荐的 Agent 提示模式:
持久性提醒:帮助 GPT-5.2 在长流程、多步骤的工作流中持续进行推理。
明确的工具使用期望:通过引导 GPT-4.1 在事务操作中调用工具以获取权威信息,从而抑制幻觉答案。
结构化规划:利用 GPT-5.2 更深入的推理能力来规划并执行多步骤任务。
Agent 驱动的富媒体决策:依靠 GPT-5.2 检测并指示何时工具调用应返回图像、视频、表单或其他富媒体、多模态元素。 这些模式共同帮助模型可靠地将非结构化请求映射到多步骤工作流,并在不连续交互中保持状态。 很少有行业像航空公司那样清晰地展现出对多步骤推理的需求。在一个交互中,通常需要跨越多个系统和策略层。一个简单的问题可能涉及检查票价规则、重新计算忠诚度福利、发起机票变更以及与航班运营协调。Mehta 指出:“在航空业,上下文每分钟都在变化。AI 必须推理客户所处的场景——而不仅仅是执行一个孤立的任务。这就是为什么情境感知比单纯的工作流重要得多,也是为什么以上下文为主导的集成架构至关重要。” 借助 GPT-4.1 和 GPT-5.2,Netomi 可以不断将这些模式扩展到更丰富的多步骤自动化中——不仅使用模型来回答问题,还用于规划任务、排序操作,并协调大型航空公司所依赖的后端系统。
在高压力时刻——例如暴风雨期间重新订票、解决计费问题或处理突然的需求激增——任何犹豫的系统都会被用户抛弃。延迟定义了信任。 大多数 AI 系统失败是因为它们按顺序执行任务:分类 → 检索 → 验证 → 调用工具 → 生成输出。Netomi 则设计了并发架构,充分利用了 GPT-4.1 的低延迟流式和稳定的工具调用能力。 GPT-4.1 提供了快速的首次令牌生成时间和可预测的工具调用行为,这使得这种架构在大规模下可行;而 GPT-5.2 则在需要时提供更深层次的多步骤推理路径。Netomi 的并发框架确保整个系统(而不仅仅是模型)保持在关键的延迟阈值以下。 这些并发需求并非航空公司独有。任何暴露于突然、极端流量激增的系统都需要同样的架构原则。例如,DraftKings 定期对此模型进行压力测试,在重大体育赛事期间,流量会飙升至每秒超过 40,000 个并发客户请求。在这些事件中,即使工作流涉及账户、支付、知识查询和法规检查,Netomi 仍能保持低于三秒的响应时间和 98% 的意图分类准确率。 DraftKings 联合创始人兼运营总裁 Paul Liberman 表示:“AI 对于我们如何在最关键的时刻支持客户至关重要。Netomi 的平台帮助我们以敏捷性和精确性处理巨大的活动高峰。” 在规模上,Netomi 的并发模型依赖于 GPT-4.1 快速、可预测的工具调用能力,这确保了多步骤工作流在极端负载下仍能保持响应。
企业级 AI 必须从设计上就值得信赖,将治理直接融入运行时——而不是作为外部层添加。 当意图置信度低于阈值,或者当请求无法以高确定性分类时,Netomi 的治理机制会介入,决定如何处理该请求,确保系统从自由生成模式退回到受控的执行路径。 在技术层面,治理层负责:
模式验证:在执行前,对照预期的参数和 OpenAPI 契约验证每个工具调用。
策略执行:在推理和工具使用过程中内联应用主题过滤器、品牌限制和合规性检查。
PII 保护:作为预处理和响应处理的一部分,检测并屏蔽敏感数据。
确定性回退:当模型不确定性过高时,回退到已知更安全的路径。 这种内置的治理架构确保了 AI 系统的行为始终在企业可接受的边界内,从而构建了信任的基础。
Netomi 的实践为企业在真实生产环境中规模化部署 AI Agent 提供了宝贵的蓝图。从为真实世界的复杂性而设计,到通过并行化满足严格的延迟要求,再到将治理融入运行时,这些经验教训对于任何希望利用 AI 提升运营效率的企业都具有重要的参考价值。 随着 GPT-4.1 和 GPT-5.2 等模型的不断演进,我们可以期待看到更多像 Netomi 这样的创新应用,它们将推动 AI 从辅助工具向真正的自主智能体进化,最终重塑企业的运营模式。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

英伟达内部实践显示,ChatGPT Work正帮助企业团队将信息整合工作自动化,每周节省16小时,并将原型开发周期从数周缩短至数天。这一案例揭示了AI工作流从工具到组织资产演进的趋势。

OpenAI 将 GPT-5.6 系列模型(Sol、Terra、Luna)集成至 Kiro 开发代理,通过规格驱动方法实现约 82% 的成本降低,标志着 AI 编程从能力竞赛转向成本效率竞争。

OpenAI因模型网络能力逼近关键门槛而调整开发策略,强调安全需贯穿训练全周期。文章解析其技术升级,并对比国内AI安全建设路径。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。