缺陷即特性:Runway的AI创新

从Bug到功能:Runway的AI视频创新之路
Runway公司曾花费数周时间尝试解决一个棘手的bug:在实时视频生成过程中,AI创建的智能体头像会逐渐偏离画面中心。然而,最终的解决方案并非来自后端的补丁修复,而是一个全新的前端功能,巧妙地绕过了这个问题。这一经验正是Runway ML企业产品负责人瑞恩·菲利普斯在VB Transform 2026大会上分享的核心内容,他强调即使不自行构建基础模型的公司,也能从Runway的模型构建、评估和发布过程中汲取宝贵经验。
“我认为,即使你们并非都在自行构建模型,了解我们的方法也大有裨益,因为几乎所有这些经验都适用于你们日常的工作,”菲利普斯表示。
Runway是一家致力于构建通用世界模型的AI应用研究公司,其开发的生成式工具正是基于这些模型。在演示中,菲利普斯展示了Runway Characters这一实时视频模型,它实现了与AI生成智能体的零延迟互动。他指出,五年前,艺术家们需要花费数百小时拼接单个帧才能生成带有模糊文本和低帧率的视频,而现在,Runway的模型能够即时生成交互式视频内容。
“我们构建这些实时模型的方式,可以为今天你们公司在构建和部署实时体验(无论是否涉及智能体)提供灵感,”他说道。
评估体系的构建
打造稳健的AI产品始于高质量的评估集。然而,创建这一评估集不能仅视为工程任务,它需要产品、设计、研究和销售团队之间的深度跨部门协作,共同定义”质量”的真正含义。
菲利普斯强调,团队应定期举办内部研讨会,让成员共同审核生成的示例,目标是让整个组织就具体的失败模式达成共识,从而共享统一的成功生成标准。
“我们花大量时间与团队合作,反复审视成功与失败的示例,甚至包括那些极其细致和挑剔的标准,”菲利普斯分享道。
最终的评估集必须覆盖广泛的客户使用场景以及极端的边缘案例。例如,菲利普斯提到,为确保模型在超出标准人脸结构的情况下仍能保持可预测性,他们使用了名为”Tooth”的非人类角色——这个角色没有鼻子,牙齿也非常奇特。
在评估这些生成结果时,Runway团队会寻找细微的失真迹象。在一个例子中,虽然角色面部保持完整,但背景元素(如网状物)开始变形,这被严格评为失败案例。
尽管产品处于前沿技术领域,但Runway用于跟踪评估的工具却十分简单:一个Excel电子表格。团队每天记录测试结果,将输出根据预设的通过率分为”轻微”或”严重”失败。
“我们在项目开始前设定通过率的标准,一旦达到这一标准,我们就发布模型,所以这并非什么魔法,”菲利普斯解释道。
对于面临实时管道中非确定性质量漂移的企业开发者来说,大规模人工评估是一个瓶颈。为此,菲利普斯指出,开发者可以依赖语言模型来自动化视觉评分过程。
“语言模型在成为许多内容的评判者方面表现相当出色,特别是在评估集中可能出现的变形或变化类型,”他表示。团队还可以向语言模型提供背景信息(如手绘草图或广告的结构布局),以指导生成和验证过程,确保质量的同时不增加终端用户的认知负担。
模型训练与缺陷转化策略
实现实时生成视频需要高度优化的技术栈。过程始于预训练一个庞大的基础模型,这一步骤资源密集且生成输出速度缓慢。为了实现实时延迟,Runway依赖蒸馏技术,即训练一个更小、更快的”学生”模型来模仿大型”教师”模型。据菲利普斯介绍,蒸馏技术帮助Runway将”80%到90%的生成时间”缩减。
随后,团队对蒸馏后的模型应用对抗性后训练(APT)。这一技术通过针对专门设计用于发现模型缺陷的系统进行测试,迫使模型持续改进,帮助恢复蒸馏过程中损失的视觉清晰度。
然而,修改模型架构会引入新问题。在蒸馏和APT阶段,团队遇到了一个顽固的bug:在实时生成过程中,角色会摇摆或偏离画面中心。
菲利普斯表示,团队花费数周尝试修复核心模型以消除这种偏移。最终,他们发现如果用户的初始输入图像完美居中,生成的视频就会保持稳定。与其在后端工程修补上花费更多时间,Runway转向了用户体验解决方案。
“我们注意到评估中的这个问题后,就想,’如果我们将其作为一个功能提供会怎样?’如果用户给我们的角色向左转头,我们知道视频会发生变形。我们就直接为他们解决,”菲利普斯说道。
他们引入了一个名为”优化图像质量”的前端功能,在生成开始前自动将用户图像重新居中。通过将后端模型限制包装在前端工具中,用户感受到的是有用的功能而非工程缺陷。
“将模型限制转化为产品功能,从而真正扩展模型的工作方式,”菲利普斯建议道。”内部看来可能像是一种限制,但如果你将其作为产品功能构建,你的客户不会这样看待它。”
基础设施细节的关键作用
以每秒24帧的速度在全球范围内提供视频,需要优化基础设施栈的每一层,从缓存和并行解码到与Nvidia等硬件提供商合作进行的深度内核更改。
菲利普斯提到,在推出Runway Characters后不久,团队注意到8%的API调用降至每秒16帧,导致客户视频卡顿。寻找根本原因需要深入的可见性分析。团队使用由Claude驱动的AI智能体结合Datadog和Sentry等监控工具来追踪异常,最终将问题锁定在us-east-1区域的一个数据中心。
“解决方案实际上不是修复任何东西或更改配置,”菲利普斯解释道。”他们实际上去数据中心物理更换了那些GPU,这最终解决了问题。”
对于部署实时应用的企业团队来说,启示很明确:硬件和基础设施异常将直接影响模型性能,需要严格的全栈调试能力。
“不要忽视所有细节,因为部署这些模型时细节实在太多了,”菲利普斯总结道。
从”失败地狱”中成长
AI系统的开发很少是线性过程。团队常常会陷入”失败地狱”,在单个问题上卡数周而看不到尽头,菲利普斯将这一阶段称为”失败地狱”。
“我们必须经历这种痛苦,真正为问题挣扎一段时间,才能获得突破,”他表示。持续的迭代最终会…
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!