TsingtaoAI赋能新能源维保智能化,携手厦门电池龙头企业完成设备级 AI Agent 技术实训

 

近日,TsingtaoAI 派驻资深技术专家,赴厦门某新能源电池龙头企业开展了为期两天的"设备级 AI Agent 开发与架构设计"深度技术实训。本次实训聚焦大模型驱动的智能体在设备维保运营场景中的工程化落地,助力企业技术团队完成从传统 IoT 逻辑向 LLM-Driven 智能体的认知升级与实战能力构建。

聚焦维保运营,拒绝"AI 幻觉"

本次实训以该企业核心业务——储能电池及新能源设备的维保运营为主线,围绕巡检诊断、工单派发、维修调度、运营分析全流程展开。课程设计秉持"拒绝幻觉"原则,全面采用 Structured Outputs 与有限状态机(FSM)技术路线,确保所有核心业务流程可控、可校验、可回溯,充分契合新能源与储能行业的高安全要求。

实训采用"单栈聚焦"策略,核心逻辑统一在 Python 生态(LangGraph)中编排,降低学员技术栈切换成本,保证两天内实现内容深度与项目完成度的双重保障。

四大模块层层递进,从单机到多智能体协同

两天实训设置了四大核心模块,循序渐进:

  • DAY 1 上午,学员完成了设备上下文(Device Context)抽象层设计,将锂电池电芯、BMS 参数、储能逆变器状态映射为维保运营语义,并基于 Pydantic v2 构建了设备档案、工单、备件、人员等领域强类型模型。实训中,学员亲手编写了"储能电池寿命与健康度(SOH)全自动巡检维保 Agent",实现从数据采集到标准 JSON 维保建议输出的全流程闭环。

  • DAY 1 下午,实训进入多智能体协作攻坚阶段。学员基于 LangGraph 搭建了"主 Agent + 设备 Agent"分层架构,实现了电池簇诊断专家、温控系统诊断专家、维保策略师等多 Agent 的协同工作,并完成了 A2A(Agent-to-Agent)会话协议、优先级抢占机制、飞书会话接入等企业级特性的开发。

  • DAY 2 上午,重点攻克 Function Calling 与维保运营工具调用。学员将工单系统、备件库、排班系统封装为 Agent 可调用的 Tool,并设计了安全拦截栅栏(Guardrails),实现"格式层—规则层—语义层"三级校验,确保 AI 生成的每一份工单都符合企业 SOP。

  • DAY 2 下午,学员完成生产级高可用优化与本地量化部署实践,并在 Capstone 终极大作业中交付了完整的"光储一体化电站智能维保运营 Agent 系统",涵盖故障根因定位、结构化维保工单生成、多 Agent 联动诊断、飞书消息卡片推送等全链路能力。

实战导向,压力测试检验真功夫

本次实训的一大亮点是"拒绝理想化数据"。实训中专门设置了脏数据注入、资源冲突仲裁、断点续传验证、多设备同时告警等压力测试环节,要求学员在真实工程约束下完成容错设计。最终评审阶段,技术专家现场注入未提前告知的边界用例,对系统的鲁棒性、工具调用精确性、架构解耦程度进行了严格考核。

课程整体设计原则

  • 单栈聚焦:核心逻辑统一在 Python 编排(LangGraph),聚焦设备维保运营场景,不引入 C# .NET(Semantic Kernel)技术栈,降低学员技术栈切换成本,保证两天实训的内容深度与完成度。

  • 拒绝幻觉: 针对新能源与储能高安全要求的特性,重构 Agent 设计。放弃不确定的纯文本 Loop,全面采用主流的 Structured Outputs 与 FSM,所有核心业务流程均可控、可校验、可回溯。

  • 维保运营导向: 课程设计围绕设备维保运营全流程展开,从巡检诊断、工单派发、维修调度到运营分析,构建完整的智能维保运营体系,所有案例、工具、实训均贴合工业现场真实业务规则。

  • 多 Agent 分层架构: 采用"主 Agent + 设备 Agent"分层协作模式,主 Agent 负责全局调度与决策,各设备 Agent 负责具体设备的诊断与维保执行,通过 Agent-to-Agent 会话协议实现高效协同,支持按设备域并行扩展。

 

1

DAY 1 上午:

Device Agent 架构重构与维保运营场景构建

 

目标: 完成传统 IoT 逻辑向 LLM-Driven 智能体的认知升级,跑通合规的大模型底层链接与确定性设备维保运营控制。

模块一:

2026 智能体技术前沿与维保运营场景抽象层设计

面向设备维保运营的硬件抽象层(HAL)解耦设计

  • 将锂电池电芯、BMS 参数、储能逆变器(PCS)状态抽象为大模型可识别的 Device Context(设备上下文),并映射到维保运营语义(如:健康度预警、维保周期预测、备件库存联动)。

  • 补充设备上下文分层分级设计:区分静态档案(出厂额定容量、安装日期、电芯型号)、动态遥测(秒级电压/温度/电流采样)、事件型数据(历史告警、故障工单)三级,分别对应不同的上下文注入策略——静态档案固化进系统提示词,动态数据做实时切片注入,事件数据通过向量检索召回,避免全量数据堆砌导致 Token 浪费。

  • Prompt Caching 优化:针对高频变化的设备遥测数据,设计长上下文下的成本控制策略,重点优化维保运营场景下的历史工单、设备履历等长文本缓存;补充字段对齐与脏数据预处理规则,明确 SCADA 原始字段到维保业务字段的映射字典,配套通信中断空值填充、超量程数据截断等清洗逻辑,从源头减少 Agent 误判。

大陆本土主流模型与工程初始化

  • 阿里云 DashScope 与本地私有化 DeepSeek 接口的鉴权、流式输出(Streaming)与异常重试机制。

  • 补充双模型容灾切换逻辑:在 Python SDK 层封装模型路由,默认调用私有化 DeepSeek,出现推理超时、输出校验不通过时自动降级到通义千问备用链路,同时记录失败日志用于效果复盘,适配工业场景的高可用要求。

  • Python 环境: Pydantic v2 的设备状态与维保工单强类型定义,构建维保运营领域模型(设备档案、工单、备件、人员);补充嵌套字段的自定义校验规则,通过 @field_validator 实现业务规则前置校验——如工单优先级仅限 P0-P3、备件数量必须为正整数、单工单预计工时不超过 8 小时,在数据进入大模型前完成值域约束。

模块二:

ReAct 范式与确定性维保运营控制

(Structured Outputs)

从 ReAct 走向反思(Reflection)演进

  • 经典 ReAct 在设备维保运营中的致命缺陷(如:错误生成不存在的维保工单、误判设备故障等级)。

  • 补充典型失效场景复盘:结合储能真实案例拆解——面对“电芯温差过大”告警,纯 ReAct 容易反复调用查询工具无法收敛,或跳过故障等级判定直接生成工单,本质是缺乏业务边界与步骤上限约束。

  • 构建"双回路"智能体:执行回路 + 维保运营安全栅栏(Guardrails)回路,确保工单生成、排班调度等关键操作的合规性;补充栅栏回路三类触发阈值:步骤阈值(单轮超 5 次工具调用强制反思)、风险阈值(高压操作、备件出库必须二次校验)、一致性阈值(连续两次结论不一致触发复核)。

基于 JSON Schema 的 Structured Outputs

  • 利用大模型原生能力(如 DeepSeek/Qwen 的 JSON Mode)强制输出符合维保运营协议的报文结构(如:标准工单 JSON、维保建议书、设备健康评估报告)。

  • 补充多粒度输出动态切换方案:针对同一诊断流程设计“简版结论”“标准工单”“完整评估报告”三套 Schema,Agent 根据告警等级自动选择输出粒度,平衡推理成本与信息完备性。

  • 补充输出校验与自修复闭环:模型输出后增加 Pydantic 解析校验,出现字段缺失、类型错误时,自动将错误信息回传大模型要求补正,最多重试 3 次,大幅提升结构化输出成功率,避免格式错误中断业务流程。

【实训演练 1】:单机版"储能电池寿命与健康度(SOH)全自动巡检维保 Agent"

  • 场景:模拟获取昆仑系列储能电池的充放电循环、温升及容量衰减数据,结合历史维保记录进行综合分析。

  • 任务:编写 Agent,自主决定何时触发内阻测试评估、何时生成预防性维护工单,并最终输出一份标准 JSON 格式的维保运营建议(含优先级、预计工时、所需备件)。

  • 补充基准对照环节:提供人工专家出具的标准维保结论作为参考答案,学员完成开发后做字段级比对,重点核查故障等级、备件选型、工时预估的准确性,直观感受结构化输出的可控性。

  • 补充鲁棒性测试环节:实训中故意注入脏数据(温度空值、循环次数为负、工单格式错乱),要求学员增加预处理与异常兜底逻辑,训练工程化容错思维,而非仅处理理想干净数据。

 

2

DAY 1 下午:工业级 Multi-Agent 协作网络

与维保运营状态机编排

 

目标: 攻克复杂、多步骤的设备维保运营协同场景,掌握企业级 Multi-Agent 框架设计(Python LangGraph),实现主 Agent 与多设备 Agent 的高效协作。

模块三:多智能体协作范式——主 Agent + 设备 Agent 分层架构

Multi-Agent 核心协作模式深度解析

  • 主 Agent(Master Agent)- 设备 Agent(Device Agent)分层架构:

    主 Agent 负责全局维保运营调度:接收飞书会话指令、分配任务到各设备 Agent、汇总维保决策、生成运营报表。

    设备 Agent 1/2/3(Device Agent):分别负责特定设备(如:电池簇 Agent、逆变器 Agent、温控系统 Agent)的专项诊断、维保工单生成与执行跟踪。

  • 补充设备 Agent 能力边界规范:明确每个设备 Agent 仅可访问自身管辖的数据与工具,禁止跨域操作——如电池簇 Agent 无权直接控制温控阀门,必须通过 A2A 请求由温控 Agent 执行,从架构层面规避误操作风险,也便于后续按域并行迭代。

Agent-to-Agent 会话协议设计:

  • 定义 A2A(Agent-to-Agent)消息格式:包含消息类型(REQUEST/RESPONSE/NOTIFY)、会话 ID、优先级、设备上下文摘要。

  • 会话状态管理:待处理、处理中、已完成、异常挂起,支持会话超时与重试机制。

  • 上下文压缩与传递:主 Agent 向设备 Agent 派发任务时,如何压缩设备上下文避免 Token 爆炸;设备 Agent 向主 Agent 汇报时,如何结构化提取关键结论。

  • 补充优先级抢占机制:协议中增加优先级字段与抢占逻辑,P0 级故障的联动请求可中断设备 Agent 当前的低优先级巡检任务,优先处理紧急故障,贴合工业现场“故障优先”的运营原则。

  • 网状对等协作模式(Peer-to-Peer): 适用于分布式储能电站集群的跨设备维保联动(如:某设备 Agent 发现故障需联动其他设备 Agent 进行关联诊断)。

Python 侧前沿框架:基于 LangGraph 的确定性图编排

  • 利用 State(状态字典)管理多设备长周期维保交互中的"记忆"(如:设备 A 的待处理工单、设备 B 的维修进度)。

  • 补充状态增量更新与回滚机制:设计 State 版本号,每个节点执行完成后递增版本并留存变更快照,节点执行失败时可回滚到上一稳定状态重试,避免局部错误导致整个工作流崩溃,适配长周期维保任务的稳定性要求。

  • 使用 Nodes(执行节点)和 Conditional Edges(条件边)将维保运营 SOP 固化,彻底解决多 Agent 相互推诿、无限循环(Infinite Loops)问题。

  • 补充业务规则固化原则:将维保 SOP 中的分支逻辑(如“温升超 15℃ 走紧急处置分支,否则走常规巡检”)全部固化为条件边判断函数,而非交给大模型自由判断,确保核心流程 100% 符合企业制度。

  • 主 Agent 调度节点设计: 实现任务路由、负载均衡、冲突仲裁(如:两个设备 Agent 同时请求同一维修工程师时的调度策略)。

飞书会话到设备 Agent 的接入设计

  • 飞书会话层架构: 将飞书 IM 作为人机交互入口,运维工程师通过飞书会话与主 Agent 交互,主 Agent 自动将任务分发给对应的设备 Agent。

  • 补充角色权限校验:在事件回调入口对接企业飞书组织架构,区分运维工程师、班组长、管理员三类角色,不同角色可触发的操作不同——普通工程师仅能发起巡检查询,班组长可确认工单,管理员才可修改 SOP 配置。

  • 飞书事件回调机制: 接收飞书消息事件(文本、卡片、按钮点击),解析用户意图,路由到主 Agent 的 LangGraph 工作流。

  • 会话上下文同步: 飞书会话线程与 Agent 会话状态的双向绑定,确保运维工程师在飞书端能实时查看设备 Agent 的处理进度与结果。

  • 补充长会话上下文截断策略:设计“保留最近 3 轮交互 + 核心结论摘要”的压缩规则,超阈值历史对话自动生成摘要存入状态,既保证连贯性,又避免 Token 持续膨胀。

  • 消息卡片渲染: 设备 Agent 返回的结构化维保结果(工单、诊断报告)自动渲染为飞书消息卡片,支持一键确认、驳回、转派等操作。

模块四:多源设备异常隔离与维保运营会话持久化

跨 Agent 的状态同步与消息总线设计

  • 当设备 Agent-A(BMS 诊断专家)需要向设备 Agent-B(温控系统诊断专家)发起联动诊断请求时,A2A 会话的 Token 压缩与上下文裁剪艺术。

  • 补充消息总线幂等性设计:基于会话 ID + 消息序号实现去重,避免网络波动导致消息重复投递、设备 Agent 重复执行诊断,确保同一条告警只触发一次协同流程。

  • 当主 Agent 需要向排班维护专家 Agent 派发工单时,如何确保工单信息完整、优先级准确、备件库存已校验。

  • 利用 Redis / PostgreSQL 在大陆环境下实现 Agent 记忆状态的分布式持久化与断点续传,支持维保运营长周期任务(如:跨班次的维修跟踪)。

  • 补充分层存储策略:当天活跃任务、进行中会话等热数据存 Redis,保证低时延读写;历史工单、完结记录等冷数据存 PostgreSQL,支持长期回溯;每日凌晨自动归档完结会话,平衡性能与存储成本。

【实训演练 2】:多机协同"工商业储能微网异常协同维保隔离与修复 Agent 系统"

场景:某个高功率产品 PACK 在宽温域运行时发生局部过热或脉冲放电异常,需多设备 Agent 协同诊断并生成维保方案

任务(Python LangGraph):

  • 主 Agent(维保调度中枢): 接收飞书会话指令或系统告警,解析异常类型,调度到对应设备 Agent;汇总各设备 Agent 诊断结论,生成统一维保决策。

  • Agent 1(电池簇诊断专家): 解析电池遥测数据,发现温升异常,通过 A2A 会话向主 Agent 汇报,并请求温控系统 Agent 联动诊断。

  • Agent 2(温控系统诊断专家): 接收 A2A 联动请求,分析温控回路状态,向主 Agent 反馈温控能力评估。

  • Agent 3(维保策略师): 接收主 Agent 汇总的诊断结论,查阅预置 SOP(向量数据库/知识库),生成维修工单(含工时、备件、人员安排),并通过飞书卡片推送给运维工程师确认。

补充资源冲突场景模拟:实训中设置“电池簇 Agent 与逆变器 Agent 同时申请同一名资深工程师”的冲突场景,要求学员在主 Agent 中实现仲裁逻辑,按故障优先级、技能匹配度、紧急程度打分排序,深化对调度职能的理解。

补充断点续传验证:学员完成开发后,人为中断某设备 Agent 的诊断进程,重启后验证系统能否从断点继续执行,检验持久化设计的有效性,贴合工业系统 7×24 小时运行要求。

 

3

DAY 2 上午:

设备功能调用(Tool-Use)与维保运营协同实战

 

目标: 让 Agent 具备真正的"维保运营动手能力",掌握大模型如何通过 Python 准确调用维保运营工具(工单系统、备件库、排班表、飞书通知),实现从诊断到工单闭环。

模块五:Function Calling 机制与维保运营 Tool 强类型映射

大模型如何"理解"并生成维保运营函数入参

  • 深入剖析大模型对 tools 定义字段的 Attention 分布规律,重点优化维保运营场景(如:工单创建、备件查询、人员排班)的 Tool Description 编写技巧。

  • 补充负向示例约束法:在 Tool 定义中不仅说明“用来做什么”,还补充“什么情况不该调用”——如“创建工单仅用于确认故障后生成维修任务,不可用于查询库存、咨询方案”,通过明确边界减少工具误调用率。

  • 如何编写高成功率的 Tool Description(提示词工程中的函数描述技巧),确保 Agent 能准确选择"生成工单"而非"查询库存"。

  • 补充枚举值收敛技巧:对工单类型、故障等级、备件品类等有限集合的参数,在 Tool 定义中完整列出可选值,而非让大模型自由生成文本,从源头降低入参错误概率。

Python 侧的 Tool 绑定与维保运营异步执行

  • 补充工具超时与熔断机制:为每个 Tool 配置独立超时时间(如备件查询 3 秒、创建工单 5 秒),连续 3 次调用失败则标记为不可用,Agent 自动切换备用方案,避免单工具故障拖垮整体流程。

  • 不深入底层通信协议(Modbus/CAN/WebApi),聚焦上层维保运营 API(如:工单系统 REST API、备件库查询接口、飞书消息推送 API)的封装与调用。

  • 补充并发调用结果聚合逻辑:针对多设备同时巡检场景,设计异步并发调用 + 按设备维度聚合的逻辑,统一交给大模型分析,相比串行可缩短一半以上响应时间。

Python 侧的 Tool 绑定与维保运营异步执行

  • @tool 装饰器与异步 asyncio 的结合,处理多设备 Agent 并发的维保状态轮询与工单状态更新。

  • 补充工具超时与熔断机制:为每个 Tool 配置独立超时时间(如备件查询 3 秒、创建工单 5 秒),连续 3 次调用失败则标记为不可用,Agent 自动切换备用方案,避免单工具故障拖垮整体流程。

  • 不深入底层通信协议(Modbus/CAN/WebApi),聚焦上层维保运营 API(如:工单系统 REST API、备件库查询接口、飞书消息推送 API)的封装与调用。

  • 补充并发调用结果聚合逻辑:针对多设备同时巡检场景,设计异步并发调用 + 按设备维度聚合的逻辑,统一交给大模型分析,相比串行可缩短一半以上响应时间。

维保运营 Native Tool 开发

  • 将企业现有的维保运营系统(工单系统、ERP 备件库、人员排班系统)封装为 Agent 可调用的 Tool。

  • 补充审计日志设计:每一次 Tool 调用都记录调用方 Agent ID、入参、返回结果、耗时等完整信息,存入独立审计表,支持事后追溯哪次决策调用了什么系统、产生了什么业务影响,满足工业运维可审计要求。

  • 设计 Tool 的幂等性与安全校验:防止 Agent 重复创建工单、超发备件、错误排班。

  • 补充分级审批工具设计:对高风险操作(批量下发维保指令、大额备件出库)封装为“预申请-审批-执行”两步式工具,Agent 先提交申请,负责人飞书审批通过后才触发实际执行,将 AI 决策权控制在辅助范围,核心操作保留人工终审。

模块六:维保运营协同架构与安全拦截栅栏(Guardrails)

维保运营场景的数据与控制流

  • 主 Agent 负责全局维保运营决策与飞书会话交互;设备 Agent 负责专项诊断与维保执行;两者通过 A2A 会话协议协同。

  • 补充控制流与数据流分离设计:A2A 会话仅传递控制指令与结构化结论,不传递原始遥测大文件;原始数据通过设备总线独立传输,设备 Agent 按需拉取,避免带宽与 Token 浪费,也符合工业数据权限管控要求。

  • 飞书会话层作为统一人机交互入口,实现"一句话派单"、"一键确认工单"等便捷操作。

  • 补充运营看板数据回流路径:设计 Agent 系统到运维看板的数据接口,主 Agent 每日自动汇总工单量、故障分布、平均处理时长等指标,推送到企业运营看板,实现从设备诊断到运营分析的全链路闭环。

维保运营中的安全防线:LLM 输出语义校验

  • 输入/输出拦截技术:检测 Agent 生成的维保工单是否合规(如:防止生成负数的备件数量、超出预算的维修费用、不合理的排班时间)。

  • 补充三级校验流程:构建“格式层-规则层-语义层”逐级校验——格式层查 JSON 结构与字段类型,规则层查 SOP 硬性约束,语义层查是否偏离业务范围,越靠后校验成本越高,在安全与性能间取得平衡。

  • 维保运营规则引擎:将企业维保 SOP 固化为可校验规则(如:高压设备维修必须双人作业、备件库存不足时禁止生成领料工单)。

  • 补充违规分级降级策略:输出被拦截时并非直接报错,按等级处理——轻微格式错误自动修正,一般规则违规要求重生成,严重语义违规则终止流程并推送人工介入,同时记录违规样本用于后续优化。

【实训演练 3】:双向联动"基于维保运营 Tool 调用的智能 BMS 参数巡检与维保策略切换 Agent"

  • 场景:模拟针对耐低温"冰峰电池"在 -20℃ 极端环境下的巡检告警与维保策略切换。

  • 任务: 编写 Python Tool(模拟查询工单系统、推送飞书通知),Agent 自主发现环境温度骤降告警后:准确执行 Function Calling 查询历史维保记录;生成预防性维护工单并推送飞书卡片给运维工程师;工程师在飞书端一键确认后,Agent 更新工单状态并触发后续跟踪。

  • 补充多条件策略切换:设置不同的低温持续时长与电池 SOC 档位,要求 Agent 按规则自动切换策略——短时低温仅推送预警,持续低温且 SOC 低于 30% 则生成加热维保工单,训练多维度决策能力。

  • 补充人工反馈闭环实现:要求实现飞书卡片“驳回并填写原因”功能,驳回原因回传 Agent 后,需调整方案重新提交,完整复现“AI 生成-人工审核-反馈优化”的真实协作流程。

 

4

DAY 2 下午:生产级高可用优化、本地量化部署

与 Capstone 终极大作业

 

目标: 解决 Agent 走向生产环境的临门一脚问题——稳定性评估、Low Latency、轻量化部署及综合实战检验,重点聚焦维保运营场景的可靠性。

模块七:Agent 性能调优、链路追踪与本地量化

工业级 Agent 链路监控与 Observability

  • 在大陆不依赖 LangSmith 的情况下,如何利用开源工具(如 Phoenix / Arize)或自定义 Python 日志框架实现 Agent 决策链(Thought → Action → Observation)的完整日志落盘与回溯。

  • 补充结构化埋点规范:在 LangGraph 每个节点的入口与出口统一埋点,记录节点名称、输入输出摘要、耗时、异常状态,输出标准 JSON 日志,可直接接入企业现有 ELK 平台,无需额外部署专用监控系统,降低落地成本。

  • 重点追踪:主 Agent 的任务调度链路、设备 Agent 的诊断链路、A2A 会话的端到端延迟、飞书会话的响应时效。

  • 补充核心指标与告警阈值:定义三类监控指标并配置告警——A2A 会话超时率 > 5%、工具调用失败率 > 3%、结构化输出成功率 < 95%,触发阈值自动推送告警,实现 Agent 系统的可运维、可告警。

降低长链条 Agent 响应 Latency 的硬核手段

  • 流式函数调用(Streaming Function Calling)技术:不等文本生成完毕,提前解析 Tool 报文,加速维保工单生成。

  • 补充推测解码场景适配:针对高频巡检场景,对常见故障的诊断结论与工具调用做预生成推测,大模型边生成边验证,匹配正确则直接跳过生成步骤,常规巡检响应速度可提升 30%-40%,异常场景回退正常流程。

  • 利用 DeepSeek 的 Prompt Cache 技术调优长 System Prompt,重点缓存设备维保运营领域的知识库与 SOP。

  • 补充分块缓存命中优化:将长系统提示词拆分为“领域常识”“SOP 规则”“设备档案”多个独立块,分别计算缓存键,修改某一块时仅失效对应缓存,其余仍可命中,大幅提升长上下文场景的缓存命中率。

端侧轻量级大模型(SLM)在维保运营场景的量化部署展望

  • 利用 Ollama 或 vLLM 本地部署 Qwen-2.5-7B-Instruct / Qwen-2.5-Math,在维保运营内网环境跑通低时延纯本地 Agent 闭环。

  • 补充端云协同分流策略:明确端侧与云端的分工边界——简单巡检、常规告警、本地数据查询由端侧处理,保障低时延与数据安全;复杂故障诊断、多设备协同、方案生成上传云端,兼顾成本与效果。

  • 通过 GGUF 量化(INT4/INT8)在工业 PC 或维保运营服务器上实现设备诊断、工单生成的本地推理。

  • 补充量化效果验证基准:提供一套储能维保领域测试用例集,量化部署后需跑通全部用例,确保 INT4 量化后诊断准确率下降不超过 5%,在性能与效果之间找到合理平衡点。

模块八:【Capstone 终极大作业】高确定性智能维保运营 Agent 系统交付

实战场景定义

  • 设计一个"光储一体化电站/产线智能维保运营 Agent 系统"。

  • 输入:连续 5 分钟的微网遥测时序数据(包含电芯电压不一致性增大、逆变器报警、环境高温)。

  • 要求:学员分组或独立使用 Python(LangGraph)搭建一个包含以下架构的完整框架:主 Agent(Master Agent): 1 个,负责接收飞书会话指令、全局调度、汇总决策、推送结果。设备 Agent: 至少 2 个(如:电池簇 Agent、逆变器 Agent),负责专项诊断与维保执行。自定义 Tool: 至少 2 个(如:查询工单系统、推送飞书通知、查询备件库存)。A2A 会话协议: 主 Agent 与设备 Agent 之间具备完整的请求-响应-通知会话机制。飞书接入: 支持通过飞书会话与主 Agent 交互,接收消息卡片并处理用户确认/驳回操作。

  • 系统能够实现:自动定位故障根因;通过结构化 JSON 生成安全范围内的维保工单;通过 A2A 会话协调多设备 Agent 完成联动诊断;生成一份面向现场运维工程师的中文排故工单,并通过飞书推送。

  • 补充递进式难度要求:设置基础版与进阶版两级交付标准——基础版跑通核心流程,实现告警到工单闭环;进阶版增加异常兜底、资源调度、人工反馈闭环等特性,适配不同基础的学员。

  • 补充文档交付要求:除代码外,需提交《系统架构设计说明》,包含 HAL 设计、A2A 协议定义、安全栅栏规则、工具清单与权限说明,训练架构设计与文档输出能力,贴合企业真实项目交付标准。

现场成果 Review 与专家点评

  • 评审标准:重点看代码的鲁棒性(LLM 输出错误 JSON 时是否有 Try-Catch 与反思重试)、Tool 调用的精确性、A2A 会话的可靠性、飞书接入的完整性、以及架构的解耦设计(主 Agent 与设备 Agent 是否职责清晰、是否可独立扩展新设备 Agent)。

  • 补充现场压力测试环节:评审时现场注入 3 组未提前告知的边界用例(多设备同时告警、工具接口异常、脏数据输入),观察系统容错能力与稳定性,而非仅运行预设正常场景。

  • 补充可扩展性考察:现场要求学员演示“新增一个 PCS 设备 Agent 需要修改多少代码”,评估架构解耦程度与可维护性,引导学员关注长期迭代价值,而非仅完成单次功能开发。

关于TsingtaoAI

 
 

TsingtaoAI志在成为全球领先的具身智能训练基础设施与数据服务提供商。公司专注于破解具身智能规模化落地的“虚实鸿沟”与“数据匮乏”难题,打造基于Sim2Real双向闭环的通用机器人技能仿真基础设施。

核心产品与技术

  • VeyForge 具身数据合成平台:实现从文本、图像或 CAD 秒级生成携带完整 PhysX 物理属性的 Robot-Ready 3D 资产,解决传统仿真“能看不能训”的卡点。

  • 机器人技能仿真学习平台:建立“仿真预训练—真机测试—数据回传—仿真校准”的双向闭环迭代机制,将 Sim2Real 实体迁移成功率提升至 80% 以上,全面适配宇树、智元等四足、人形与轮式机器人。

资质与合作

  • 公司获评国家高新技术企业与北京市“创新型”中小企业,深度融入华为昇腾等国产算力生态,已为华油能源、居家康养及20+所高校等30余家标杆客户提供具身/机器人场景落地服务。

  • 获得千万元天使轮融资、长三角算力算法大赛冠军、山东省人社厅数字工程师大赛二等奖、宁波AI大赛二等奖等荣誉或奖项。

 
 

 

 

 

 
 

 

Product & Case.

产品与案例