在 SageMaker AI 上使用 vLLM-Omni 生成图像与视频(第 2 部分)
本文展示如何在 Amazon SageMaker AI 上部署两个基于同一 AWS vLLM-Omni DLC 的端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像动画化为短视频。
本文展示如何在 Amazon SageMaker AI 上部署两个基于同一 AWS vLLM-Omni DLC 的端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像动画化为短视频。
Google Research 发布 AI 视频联合导演研究,这是一套构建在 Gemini 和 Veo 之上的统一多智能体框架,通过全局优化和世界状态追踪解决长视频生成中的语义漂移与级联失败问题。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成能力,可边听边看边用动态视觉形象说话。该功能支持精确唇形同步、自然表情和流畅轮换,并可在后台异步调用工具的同时保持对话不中断。即日起在 Gemini Enterprise 中可用,支持跨 97 种语言无缝切换,所有输出均带 SynthID 水印。
推荐理由:原文给出了实时视频形象、异步工具调用和 97 语言同步等能力细节,读者可据此判断企业客服等场景的落地方式。
Higgsfield AI 借助 GPT-6 Astra 在一天内推出新视频功能,让小型企业更轻松地制作视频广告,并加速新创意工具上市。该合作显著缩短了从构思到上线的周期,提升了产品迭代速度。
Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,可将 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。
推荐理由:官方给出了 token 与成本降幅和准确率提升的具体数字,读者可据此判断该功能对长视频分析的实际价值。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成式视频能力。
推荐理由:官方介绍了场景扩展、首尾帧控制、4K 放大等新能力,读者可据此判断它是否适合接入自己的视频生成工作流。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式模拟器。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上实现约 160 帧每秒的交互式运行,支持键盘、Meta Quest 控制器或学习策略闭环控制。
推荐理由:原文给出了从离线世界模型到实时交互模拟器的能力跃迁和具体帧率数字,读者可据此判断它在手术机器人训练与评估中的适用场景。
Google DeepMind 与电影工作室 A24 宣布建立首次研究合作,旨在帮助艺术家开发新工作流程与技术,确保未来工具由创作者塑造。合作将围绕多个项目展开,让 A24 电影人直接参与技术研发,同时 Google 已对 A24 进行投资。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,支持以图像、音频、视频和文本为输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:原文给出了 Omni 系列首个模型的能力范围和开放入口,读者可据此判断它如何把多模态生成带入现有工作流。