在 SageMaker AI 上使用 vLLM-Omni 构建实时语音应用(第一部分)
AWS 发布教程,演示如何在 SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS 模型,实现文本流式输入和音频流式输出的双向实时语音应用。
AWS 发布教程,演示如何在 SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS 模型,实现文本流式输入和音频流式输出的双向实时语音应用。
本文展示如何在 Amazon SageMaker AI 上部署两个基于同一 AWS vLLM-Omni DLC 的端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像动画化为短视频。
Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,以自然语言指令驱动浏览器工作流,在早期企业用例中对浏览器工作流准确率超过 90%。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的解决方案,涵盖适配器提升、文档路由与生产安全三大挑战。通过将适配器 ID 外部化到 AWS Systems Manager Parameter Store,更新生产引用可实现零停机、无需重新部署应用,将原本耗时数小时或数天的协调工作缩短至数秒。
针对 Bluesky 上日益增多的自动回复机器人,Simon Willison 用 Opus 5.5 通过 vibe coding 开发了一款检测工具。该工具通过分析账户回复速度、是否从不发布原创内容以及回复中是否含问号等信号,识别疑似回复机器人。Bluesky 仍提供免费可用的 API,使这类调查成为可能。
Simon Willison 用 Claude Opus 5.5 将三张鸮鹦鹉照片生成包含 20 只以上像素鸟的互动派对动画,并让本地 Claude Code 借助 Playwright 脚本自动点击页面,录制出 15 秒视频用于 WeAreDevelopers 闭幕演讲的最后一页幻灯片。
GitHub Copilot app 的 canvases(画布)功能让用户无需编码即可通过 /create-canvas 技能用自然语言描述需求,生成可共享的看板、发布清单、仪表盘等自定义界面。画布支持双向交互,用户和智能体可同时更新卡片、字段或按钮,且无需单独同步步骤。创建后的画布可保存为扩展供团队或个人复用,社区还通过 Awesome Copilot 分享了现成的画布扩展。
AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。
AWS 展示了如何在 SageMaker HyperPod 上运行开源 RL 框架 SkyRL,以 GRPO 算法训练 Qwen3-VL-8B 视觉语言模型导航视觉迷宫。
AWS 机器学习博客发布 NarrateAI 系列第二篇,详解在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。该系统为超过 4,000 名 AWS 高管提供商业智能服务,实测数值准确率约 99%,流式响应约 13 秒开始输出,相比顺序评估延迟降低 86.8%。
Qwen3-TTS-12Hz-1.7B-Base 现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点,支持从数秒参考音频克隆说话人音色,无需重新训练模型。
Amazon SageMaker HyperPod 与 Qumulo 的 Cloud Data Fabric 搭配,可让训练计算与数据集分处不同 AWS 区域,无需复制数据或改代码即可保持吞吐。
GitHub Security Lab 发布 Fuzzing Taskflow,一个基于 Taskflow Agent 框架的 C/C++ 项目自动化模糊测试管线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、分析覆盖率并分类崩溃。
推荐理由:原文给出了完整的架构分层和覆盖反馈循环设计,读者可据此判断这套自动化模糊测试管线的可迁移价值。
AWS 推出 WhisperX 深度学习容器(DLC),将 OpenAI Whisper 与 wav2vec2 强制对齐及说话人分离结合,提供逐词时间戳和说话人标签。
亚马逊云科技发布参考架构,通过 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户 AI 智能体,让数据留在各业务账户本地,查询时仅流出所需数据。
NVIDIA 发布教程,讲解如何用 NVIDIA Warp 与 MuJoCo Warp(MJWarp)将 SO-101 机械臂场景从单世界 CPU 仿真迁移到最多 2048 个并行 GPU 环境。文章覆盖单世界校验、批量分配、容量调优与吞吐测量,并给出 pip install warp-lang 与 mujoco-warp 的安装入口。
推荐理由:原文给出从单世界 MuJoCo 迁移到 2048 并行 MJWarp 环境的完整步骤,读者可直接照做并复现吞吐测量。
GitHub Copilot 应用重构了 Pull Request 视图,以应对 2200 个文件、超百万行改动和 400 多条评论的极端场景。方案将文档高度拆分为确定性代码高度与动态块高度两个独立域,用单次空闲与滚动门控的测量通道替代逐块 ResizeObserver,并通过按身份而非像素的滚动锚定避免跳动。团队还构建了自主的变更、测量、改进循环,用真实信号自动定位性能问题。
推荐理由:原文拆解了超大 diff 渲染的虚拟化、测量调度与滚动锚定方案,读者可借鉴其工程取舍。
AWS 官方博客发布了一套基于 Strands Agents SDK、Amazon Bedrock、Rekognition 和 Transcribe 的智能体视频问答方案,用户可用自然语言查询视频内容。
AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。
推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。
GitHub 日韩市场负责人 Tomoko Tanaka 分享如何用 GitHub Copilot 将活动运营自动化:从单个 GitHub Issue 自动搭建落地页、生成 UTM 链接、每日筛选报名者,到会后用 /lead-upload 和 /event-report 两个斜杠命令完成 CRM 上传和报告。
推荐理由:作者用 GitHub Copilot 把活动运营流程自动化,给出了从 Issue 表单到 Skills 的完整可迁移方法。
GitHub Copilot app 新增内置 diff、终端和浏览器面板,让用户无需离开应用即可审查、运行并预览智能体对代码的改动。diff 面板以红绿高亮显示增删行,支持接受或评论;终端面板可直接运行项目命令,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成审查后可直接在应用内接受改动并创建 pull request。
Hugging Face 发布 Workflow1111,用 Gradio Workflow 以 73 个节点、11 条媒体管线重建了 AUTOMATIC1111 的 stable-diffusion-webui 主要功能,涵盖文生图、图生图、高清修复、提示词矩阵、VLM 反推提示词、检测转蒙版、ControlNet 风格标注器、背景移除、PNG Info 和图生视频。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 结合 LoRA 在 HF Jobs 上跨节点训练,通过 Storage Bucket 同步适配器而非 NCCL,并用代理路由请求。500 步训练从 3 小时 27 分钟优化到 53 分钟,速度提升 3.9 倍,代码已开源。
推荐理由:原文给出了完整的架构、代码和调优过程,读者可以据此复现跨节点 LoRA 异步强化学习训练。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 物理模拟器迁移到 C++,并总结了可复用的方法。项目先构建数值一致性校验框架,再用 Vibe CLI 生成调用树并派上百个智能体整理文档,最后采用人工把关的规划、编码、测试、审查智能体工作流逐模块迁移。
推荐理由:原文给出了用智能体迁移遗留代码的完整工作流和三条可复用原则,读者可直接借鉴到同类项目。
GitHub Copilot app 支持在同一项目上并行运行多个 AI 智能体会话,每个会话独立执行任务、互不干扰,并拥有各自的 Git worktree 和上下文,用户可随时切换且无需重新解释。通过 sessions view 可同时跟踪多个任务进度,例如在示例仓库 tailspin-toys 中并行实现 funded sort 功能、可访问性审查和测试运行,从而减少等待和上下文切换时间。
Hugging Face 发布公开教程,用 TRL 库对 LFM2.5-350M 做约500样本、100步的 GRPO 微调,在 IFStruct 基准上从22.6%提升至29.7%,其中 JSON 通过率从18.0%升至31.9%。整套流程可在免费版 Colab 或 Kaggle GPU 上运行,评估可在 MacBook 上通过 llama.cpp 完成,代码已开源在 GitHub。
推荐理由:给出了一套约500样本、100步的轻量GRPO微调配方,读者可据此低成本提升小模型的结构化输出合规率。
作者用 TRL 和 OpenEnv 复现了 Surya Narreddi 的用语言模型写 JavaScript 画水彩的项目,并开源了参考数据集、RL 环境、训练脚本和训练好的模型。
推荐理由:作者用 TRL 和 OpenEnv 完整复现了用代码画水彩的 RL 训练流程,并开源全部数据集、环境和模型,读者可据此复现或改造。