Applied AI research
面向电网规划与大型负荷的多智能体 AI 平台
四类专家智能体、混合检索,以及一套针对并网与大型负荷问题的盲评框架。
多智能体系统,2026 年至今。在加州大学伯克利分校完成,由美国能源部资助的分包项目支持。
问题
一个大型负荷接入申请,比如数据中心要几百兆瓦,会牵出一连串没有任何单一专家能独立回答的问题:它在并网排队中排在什么位置、会触发哪些电网升级、适用哪套监管流程、负荷通电之后系统的逐小时运行会变成什么样。答案分散在排队数据、规划研究、电价文件和生产模拟模型里,把它们拼起来往往要几周的专家时间。而在这几周里,排队还在变长。
我做了什么
我搭建了一个多智能体 AI 平台,它把问题路由给应该回答它的那个专家智能体,再把各部分整合成一个答案。四类专家智能体分别负责并网、基础设施、政策法规和电力系统分析,由带状态的路由层协调:对话上下文和项目状态会被保留下来,而不是把每个问题都当成全新的问题处理。每个专家通过基于 schema 的工具调用访问结构化行业数据和工程工具,因此数字来自真正持有它的那个工具,而不是模型的记忆。检索采用混合方案,把 ChromaDB 的向量检索、BM25 关键词检索与倒数排序融合(RRF)结合起来,检索范围是一个持续扩充的技术与法规知识库。
我怎么知道它有没有用
我在搭系统的同时就搭了评测与回归测试框架,因为一个语气笃定却悄悄出错的助手,比没有助手更糟。框架把固定题集跑过多个模型,对回答做盲评,并分别报告检索质量、路由准确率、工具调用正确性和回答质量。检索层或路由层每次改动,都会在同一套题集上重跑,这样性能退化会以一个数字的形式立刻暴露,而不是几周后变成一句抱怨。
评分本身也有一个值得说清楚的失效模式:恰恰在领域最难的地方,LLM 评委最不可靠。那些正确性取决于单位约定、或者取决于一个本应由工具调用返回的数值的问题,需要的是确定性的校验,而不是评委打分。
边界
这个平台服务的是准备研究的分析师。它不替代潮流计算、不替代并网研究,也不替代为这两者签字负责的工程判断。它的回答被知识库的覆盖范围所限定,所以我在维护上花时间最多的地方是知识库的覆盖度和时效性,而不是换用哪个模型。