一句话结论
AWS 推出基于 vLLM-Omni 的混合推理方案,实现同容器内图像实时生成与视频异步生成的协同工作流。
关键要点
- 同一 AWS vLLM-Omni DLC 容器内配置两个端点,分别服务 FLUX.2-klein-4B 图像模型和 Wan2.1-VACE-1.3B 视频模型。
- 图像生成采用实时推理返回内联 Base64 PNG 文件,视频生成采用异步推理结果存储于 Amazon S3 供客户端检索。
- 视频端点启用变分自编码器(VAE)分块机制以控制解码过程中的峰值内存占用。
- 默认视频生成参数为 17 帧图像序列与 30 次扩散步骤,InvokeEndpointAsync 内联 Body 大小限制为 128,000 字节。
- 在美东(弗吉尼亚北部)区域测试中,图像端点启动耗时 9 分 30 秒,视频端点启动耗时 8 分 40 秒,单次视频生成总耗时 29.6 秒。
背景与事实
亚马逊云科技(AWS)在 SageMaker AI 平台上推出了针对多模态生成任务的新部署方案,该方案基于 AWS vLLM-Omni 深度学习容器(DLC)实现。此容器封装了 vLLM-Omni 的发布版本,并额外集成了 SageMaker AI 的路由中间件。vLLM-Omni 的核心特性在于通过 OpenAI 兼容 API 将处理能力扩展至文本、音频、图像和视频等多种模态。本次部署方案在同一个容器实例中配置了两个独立的端点服务:一个用于实时处理图像生成任务,另一个专门负责视频生成任务。具体而言,图像端点加载 FLUX.2-klein-4B 模型,视频端点加载 Wan2.1-VACE-1.3B 模型。
整个工作流的数据流向设计为:首先将文本提示发送给 FLUX.2-klein 端点生成图像,随后将生成的图像连同运动提示一同发送给 Wan VACE 端点以生成视频,最终客户端从 Amazon S3 存储桶获取 MP4 格式的视频文件。在资源调度方面,部署使用固定的 ml.g6.xlarge 和 ml.g6e.xlarge 实例类型,默认在美国东部(弗吉尼亚北部)区域进行。环境创建通过 omni-sagemaker-cuda-v1.6 脚本完成,并依靠环境变量 SM_VLLM_MODEL 指定加载的具体模型,相关资源名称会写入 .vllm_omni_media_state.json 文件以便后续管理。
针对视频生成这一长时运行任务,技术实现上采用了异步推理模式以避免同步连接的超时风险。视频端点特别启用了变分自编码器(VAE)分块技术,旨在显著减少解码过程中的峰值内存消耗。在调用层面,SageMaker AI 会将推理流量转发至 /invocations 路径,DLC 内部读取 CustomAttributes 请求头并将请求转发至选定的 vLLM-Omni 路由。成功响应和调用失败信息分别存储在 Amazon S3 的不同前缀路径下。此外,若本地凭证过期,开发者可使用 --resume 参数重用已保存的资源状态,避免重复创建成本。
根据在美东地区的实测数据,ml.g6.xlarge 图像端点的启动耗时为 9 分 30 秒,而 ml.g6e.xlarge 视频端点的启动耗时为 8 分 40 秒。在生成性能方面,单次图像调用耗时 4.7 秒;视频生成环节包括 Wan VACE 模型处理延迟 8.9 秒以及从 Amazon S3 获取 MP4 文件的耗时 11.8 秒。接口限制方面,InvokeEndpointAsync 的内联 Body 限制为 128,000 字节,且 Body 参数与 InputLocation 参数互斥,开发者需根据输入大小选择合适的传参方式。
影响分析
对于中文开发者与 AI 从业者而言,这一方案降低了多模态生成应用的部署门槛。此前,将图像生成与视频生成整合在单一推理框架中往往需要复杂的异构资源调度,而本方案证明了在同一容器内通过双端点策略即可实现协同工作流。这对于需要构建“文生图+图生视频”完整应用链路的团队具有直接参考价值。分析判断认为,该架构特别适用于对内存敏感的中视频生成场景,因为 VAE 分块机制有效解决了传统视频解码导致的内存溢出问题。同时,OpenAI 兼容 API 的设计意味着现有基于 OpenAI 接口的代码逻辑可以平滑迁移至 AWS 环境,减少了适配成本。然而,开发者需注意异步接口的复杂性,特别是在处理大量并发视频请求时,需合理规划 Amazon S3 的存储检索逻辑与凭证管理策略。
适用边界
该结论主要适用于在 AWS 环境内、使用 ml.g6 系列 GPU 实例、且对实时性要求允许异步处理视频的场景。如果业务场景要求视频生成在毫秒级或秒级内同步返回且无法使用 Amazon S3 进行结果中转,则异步推理架构不适用。此外,由于 InvokeEndpointAsync 存在 128,000 字节的内联 Body 限制,若输入提示词或参考图像数据量超过此阈值,必须使用 InputLocation 方式,此时该简化工作流的即时性优势将部分削弱。本方案默认依赖美国东部区域,若国内开发者面临网络延迟或合规问题,需评估其他区域的可用性与成本差异,结论在跨国延迟敏感型应用中不完全成立。
孤本观察
本方案将图像与视频生成绑定在单一容器但不同端点的架构,体现了推理服务从“单模态孤立”向“多模态流水线”演进的工程实践趋势。判断认为,这种“容器内路由+对象存储异步化”的组合拳,正在成为云原生多模态 AI 应用的标准范式。
常见问题
FLUX.2-klein 图像端点与 Wan VACE 视频端点在 SageMaker AI 中的启动耗时分别是多少?
ml.g6.xlarge 实例上图像端点启动耗时 9 分 30 秒,ml.g6e.xlarge 实例上视频端点启动耗时 8 分 40 秒。
InvokeEndpointAsync 接口的内联 Body 大小限制是多少?超限时如何处理?
内联 Body 大小限制为 128,000 字节。若输入数据超过此阈值,必须改用 InputLocation 参数,二者互斥不可同时使用。
该混合推理方案中,图像与视频生成分别采用同步还是异步模式?结果如何返回?
图像生成采用实时同步推理,返回内联 Base64 PNG 文件;视频生成采用异步推理,结果存储于 Amazon S3 供客户端检索。
单次视频生成的总耗时是多少?由哪些环节构成?
单次视频生成总耗时 29.6 秒,包括 Wan VACE 模型处理延迟 8.9 秒及从 Amazon S3 获取 MP4 文件的 11.8 秒。
为什么视频端点要启用变分自编码器(VAE)分块机制?
为控制视频解码过程中的峰值内存占用,避免内存溢出,适配对内存敏感的中视频生成场景。