DataFlow-Harness:AI数据处理流水线新突破

DataFlow-Harness:AI数据处理流水线新突破

当要求AI智能体编写一个独立的Python脚本来解析单个JSON文件时,它通常能在几秒钟内给出完美答案。然而,当要求构建系统化的数据处理流水线时,例如处理数千个杂乱文档、分块文本、质量评分和为特定企业堆栈的检索增强生成(RAG)系统过滤噪音,同样的智能体往往会失效。

虽然大型语言模型(LLM)擅长一次性代码生成,但对于复杂数据处理任务的输出通常是自由形式的、可一次性使用的脚本。这些脚本与MLOps团队用于生产的可管理工作流抽象分离,使得它们难以通过可视化方式进行审核或编辑。

为解决这一问题,北京大学、中关村学院和上海高级算法研究院的研究人员推出了DataFlow-Harness,这是一个开源框架,引导LLM智能体逐步构建结构化的、可视化的数据处理工作流,而不是从头编写原始代码。

该框架使AI生成的流水线更易于管理和集成到现有架构中,因为生成的工件是持久且易于编辑的。

研究人员报告称,该平台在12项数据工程基准测试中实现了93.3%的端到端通过率。与标准Claude Code相比,它将API成本降低了72.5%,响应延迟减少了49.9%,同时几乎达到了与获得整个代码库来编写标准脚本的AI相同的成功率。对于企业团队而言,这意味着既能获得AI自动化的速度,又不会积累难以管理的技术债务,确保流水线保持安全、可审计且可用于生产。

“NL2Pipeline差距”

以数据为中心的AI需要用于合成数据生成、检索增强和模型训练等工作流。虽然LLM可以将自然语言转换为可执行的实现来执行这些任务,但高任务精度对于生产部署是不够的。

“第一堵墙通常不是编写Python,”DataFlow-Harness论文的第一作者何润明告诉VentureBeat。”现代编码智能体通常能快速生成合理的脚本。更难的问题是将脚本扎根到实际生产平台中:使用实际安装的算子、匹配真实的数据集模式、引用已注册的数据集和模型服务、保留各阶段之间的依赖关系,并留下其他工程师可以理解和修改的工件。”

通用AI智能体经常产生依赖幻觉,依赖不可用的算子或过时的平台假设。它们生成的不是其他工程师可以理解和修改的工件,而是难以通过工作流管理工具审核的一次性代码。

研究人员将这一挑战定义为”NL2Pipeline差距”:用户用自然语言表达工作流需求与生产环境需要结构化和持久的流水线资产之间的脱节。

研究人员在实验中证明了这一差距。例如,当Claude Code被允许使用代码库上下文编写标准、自由形式的脚本时,其成功率达到94.2%。然而,当仅限于使用平台的特定构建块创建原生工作流图时,其成功率下降到83.3%。这一差距是论文的核心发现:对于智能体来说,原生可管理的流水线比一次性代码更难生成。

“弥合这一差距不仅需要提高代码生成准确性:构建必须扎根于平台语义,并生成与主机平台集成的工件,”研究人员写道。

四个组件如何协同工作

“DataFlow-Harness改变了智能体的行动空间,”何润明说。”它不是要求智能体发出任意代码,而是通过MCP检索实时算子注册表和当前流水线状态,并对持久的DAG应用类型化、增量更改。”

为实现这一目标,该平台围绕四个组件组织工作流合成:数据流水线后端、交互层(DataFlow-WebUI)、MCP工具层和AI指导层(DataFlow-Skills)。

数据流水线后端作为对话、可视化和编程界面中权威的事实来源。它将流水线表示为有向无环图(DAG),这是一种结构化的工作流图,包含数据源、配置的预构建处理模块(研究人员称之为”算子”)和执行依赖关系。智能体不是生成自由形式的代码,而是通过”类型化变更”与后端交互,例如添加算子或连接边。

DataFlow-Skills是注入领域特定知识的markdown文件,指导模型在算子选择模式、模式推断和组装程序方面的决策。与其让AI猜测如何组装组件,不如通过技能为AI提供兼容性规则,教导它如何正确匹配不同的数据格式和处理复杂数据结构而不会破坏流水线。

MCP工具层使AI能够访问算子注册表和数据工作流的当前状态。AI通过工具层提出结构化更改。系统验证这些更改,确保工作流以有效序列运行,并且每个连接的模块都使用相同的数据语言。

DataFlow-WebUI提供两个界面,允许人类和AI共同构建工作流。开发人员可以通过对话界面用自然语言描述工作流需求。他们还可以在可视化DAG编辑器中将工作流作为图形图访问。在这里,他们可以直接检查AI提出的更改并进行修改。

“当前实现在接受流水线更改之前,会根据平台元数据执行静态检查,”何润明说。”这些检查包括已注册的数据集、算子和模型服务引用、字段流以及一些无效的参数使用情况,以及结构有效性。结果在图形编辑器中可见,可以手动修改,也可以在后续回合中由智能体修改。”

结果:93.3%通过率,72.5%更低成本

研究人员在跨越六个工业数据处理场景的12项任务基准测试中测试了DataFlow-Harness,例如问答生成、审查治理和模式规范化。他们在实验中使用Claude Opus 4.7作为骨干模型。

他们将DataFlow-Harness与三个基线进行了比较:

  • 原版CC:使用标准Claude Code的无约束编码基线。
  • 上下文感知CC:在其上下文窗口中可以访问DataFlow代码库的智能体。
  • 仅MCP:可以访问DataFlow MCP工具并被指示生成平台原生DAG的智能体(无法访问DataFlow-Skills)。

DataFlow-Harness实现了93.3%的端到端通过率,比仅MCP提高了10.0个百分点,超过了原版CC(91.7%),同时与上下文感知CC(94.2%)相差仅0.9个百分点。

重要的是,它将每个任务的API成本降低到0.261美元,比原版CC降低72.5%,比上下文感知CC降低42.8%。在生成工作流时,它比原版CC快49.9%,比上下文感知CC快17.6%。

DataFlow-Harness在依赖隐式领域知识的复杂任务上特别有效,如问答生成。基线仅MCP方法经常生成结构有效但语义错误的流水线,而DataFlow-Harness能够生成语义正确的解决方案。

该研究团队表示,他们的工作表明,通过改变AI智能体的行动空间,引导它们构建结构化工作流,而不是生成自由形式的代码,可以显著弥合”NL2Pipeline差距”,使AI生成的代码更适合生产环境。


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/orchestration/structured-ai-data-pipelines-score-10-9-points-below-free-form-code-dataflow-harness-closes-the-gap

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2281篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类