TranFu
返回

LangSmith 和 LangChain OSS 如何帮助满足 EU AI Act 要求

TFTranFu 精选2026/06/25 00:21

LangChain 博文围绕 EU AI Act 高风险 AI 系统要求,说明 LangSmith、LangChain OSS 和 LangGraph 如何支持 agent 的可观测性、事件日志、评估、数据驻留与人工监督。以下内容仅基于所给原文摘录和规则信号整理。

LangSmith 和 LangChain OSS 如何帮助满足 EU AI Act 要求
图片来源:langchain.com
文章作者、来源:langchain.com

正文

欧盟《AI 法案》的合规截止日期是 2026 年 8 月 2 日。

欧盟《AI 法案》是首部针对 AI 系统的综合性监管法规。如果你正在欧盟构建或部署高风险 AI 系统,例如用于金融服务、医疗、HR、制造业或关键基础设施,那么时间已经不多了。不符合高风险条款的处罚最高可达 1500 万欧元,或全球年营业额的 3%,以较高者为准。风险管理系统、自动事件日志、对部署方的透明度、人类监督机制、投放市场后的监测,以及事件报告,都必须能够正常运行。

许多团队已经开始推进政策工作,但你还需要搭建相应的运营基础设施来支撑这些要求。

该法案针对的是高风险 AI 系统,定义包括用于信用评分、医疗设备、招聘、生物识别身份识别、关键基础设施、执法等场景的系统。如果你正在这些类别中构建 agent,相关要求是建立风险管理系统、记录 agent 行为、让输出对部署方保持透明、确保人类能够介入,并在部署后持续监测其行为。

这些要求是为所有 AI 系统写的,包括那些会推理、检索上下文、调用工具并做出多步决策的 agent。

下面我们将拆解欧盟《AI 法案》的具体要求,以及 LangSmith 和 LangChain OSS 产品如何帮助你满足每一项要求。想快速对照,请看文末的表格。

监管机构希望看到 AI 系统所执行操作的记录。对于会做多步决策的 agent,最佳实践是追踪完整链路,包括输入、推理、工具调用和输出。

第 9 条要求在整个开发生命周期中建立一个持续运行的风险管理系统

第 12 条要求在系统整个生命周期内自动记录事件,且记录应足以识别风险、支持上市后监测,并使部署方能够进行运营监督

第 13 条要求决策过程可追溯、可解释

LangSmith 为你的 agent 执行过程中的每一步提供完整的可观测性和评估工具。

端到端 tracing 会捕获每一次 LLM 调用、工具调用和推理步骤,并附带结构化元数据:输入、输出、时间戳以及 agent 上下文。

LangSmith Studio 可将完整执行图可视化,包括状态转换和工具调用,因此你可以逐步检查智能体的决策过程。

LangSmith Insights Agent 会处理 trace 数据,自动识别并聚类重复出现的模式,帮助你发现原本需要人工审查才能找到的故障模式和使用趋势。

自定义 dashboard 可跟踪风险评分,并在指标超过阈值时通过 PagerDuty 或 webhook 触发告警。

自托管、BYOC 和托管云这几种部署选项,让你可以控制日志存放的位置以及保留时长。

在托管云中,基础 trace 的保留期为 14 天,适合短期调试和临时分析。扩展 trace 的保留期为 400 天,面向持续的模型改进、评估和人工反馈。你可以随时将基础 trace 升级为扩展 trace,并批量导出 trace 数据用于长期归档。

就 EU 数据驻留要求而言,LangSmith EU 会将所有 trace 数据保留在辖区内。使用 self-hosted 和 BYOC 选项时,整个技术栈都运行在你的 Kubernetes 集群或云区域中。你的数据不会离开你的边界。

EU AI Act 要求持续测量,并对生产流量进行评估。

该法案的要求:多项条款要求对你的 agent 输出进行持续测量:

第 10 条要求对开发和测试数据集进行数据治理和偏差审查

第 13 条要求系统具备足够的透明度,使部署方能够解读输出并恰当地使用它们

第 15 条要求披露既定的准确性水平和相关准确性指标、对抗性鲁棒性,以及对常见攻击面的防护

LangSmith 的在线评估器会对生产 trace 的可配置样本持续打分,筛选条件由你定义。每个分数都会连同完整的 trace 上下文一起记录,形成可追溯的证据链。当某项指标超过阈值时,告警会通过 PagerDuty 或 webhook 触发。

LangSmith 为以下所有领域提供了预置评估器:

基于种族、性别、年龄、宗教、国籍、残障和性取向等特征的偏见与公平性

针对个人或群体的有害内容

敏感图像和露骨内容

幻觉与答案相关性,用于捕捉会误导用户的输出

PII 泄露,用于标记敏感属性的意外暴露

Prompt injection 和 jailbreaking,用于检测对抗性输入

API 泄露和代码注入,涵盖 tool-calling agents 中常见的攻击面

用于准确性衡量的正确性、精确匹配、计划遵循度和任务完成度

用于评估智能体决策质量的工具选择和计划遵循度

每个评估器都可以自定义,你还可以针对你具体用例中的特定行为创建新的评估器。

人为监督是该法案的核心原则之一。AI 系统作出的具有重大影响的决策,应当始终可以由人质疑和纠正。实践中,这意味着要在架构中内置监督机制,明确升级路径、结构化审查工作流,以及能够证明已发生人工介入的审计证据。

对于 agentic 系统而言,这一点尤其重要。一个执行多步决策的 agent 可能会在人工有机会发现之前累积错误。在某些情况下,监督机制需要直接嵌入执行图本身。

《法案》的要求:第 14 条要求人类能够理解系统、介入系统、覆盖系统并中断系统。

LangGraph 的 interrupt 原语让 human-in-the-loop(HITL)成为 agent 图中的一等公民。你可以在任意节点暂停执行、检查状态、修改状态,然后继续运行。

LangSmith Deployment 提供了底层的持久化运行时:自动 checkpoint、exactly-once 执行,以及从精确暂停点恢复的能力。这确保了生产环境中的 HITL 中断可靠可用。

注释队列会将生产环境中的 trace 分发给人工审阅者,以获得结构化反馈。

当评估器超过设定阈值,或发生中断事件时,webhook 会被触发,因此你可以通过 PagerDuty,或你偏好的事件响应系统,通知合适的人。

8 月 2 日已经近在眼前。对于运行高风险 AI 系统的团队来说,下面介绍 LangSmith 如何帮助你满足该法案的核心技术要求。

可观测性和 tracing 是基础。对每一次工具调用、检索步骤和推理节点进行完整 tracing,能为你提供审计轨迹,也为开展评估打下基础。

对生产流量进行评估,包括对偏见、幻觉、毒性、准确性以及对抗性输入的评分,可满足《人工智能法案》关于事后市场监测的要求。

Human-in-the-loop 是一项架构要求。该法案要求人类能够对系统进行干预、覆盖和中断。LangGraph 的 interrupt 原语和 LangSmith 的标注队列让这一机制具备可审计性。

要满足欧盟数据驻留要求,部署方式同样重要。LangSmith 的欧盟 SaaS、BYOC 和完全自托管选项,都是为生产环境中的 agent 工作负载设计的。合适的选择取决于你需要多大的运维控制权,我们也很乐意一起梳理这些取舍。

这些也是团队在生产环境中把 agent 跑好的同一套实践。

LangSmith 是我们的智能体工程平台,帮助开发者调试每一个智能体决策、评估改动,并一键部署。

阅读原文

AI解读

这值得关注,因为面向欧盟高风险场景的 AI 应用不只需要政策文件,也需要可运行的工程基础设施来提供日志、评估、监督和证据链。

对 AI builder、创业者和开发者而言,合规能力可能会更早进入 agent 平台选型、部署架构和生产监控设计中,尤其是在金融、医疗、招聘、关键基础设施等场景。

建议继续观察 LangSmith 对 EU AI Act 的功能映射是否更新,并核对自身系统是否需要长期 trace 留存、EU 数据驻留、在线评估和人工干预流程。