Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
微软亚洲研究院(新加坡)迎来成立一周年。该实验室于2025年7月24日启用,是微软在东南亚的首个研究实验室,聚焦下一代AI模型与智能体系统、领域特定AI、AI原生研究实践及生态与人才发展四大支柱。其研究通过医疗、金融、教育等领域的合作推动现实应用,并与新加坡经济发展局等机构建立了战略合作。
AWS 发布教程,演示如何在 SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS 模型,实现文本流式输入和音频流式输出的双向实时语音应用。
本文展示如何在 Amazon SageMaker AI 上部署两个基于同一 AWS vLLM-Omni DLC 的端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像动画化为短视频。
Mistral 在慕尼黑开设新中心,聚焦 Physics AI 与工业 AI,并直接服务企业合作伙伴。该中心将组建 Physics AI 和工业 AI 专项研究团队,并与宝马、西门子能源及慕尼黑工业大学合作。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重架构支持模型在客户自有基础设施上运行,数据不离开组织。
Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,以自然语言指令驱动浏览器工作流,在早期企业用例中对浏览器工作流准确率超过 90%。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的解决方案,涵盖适配器提升、文档路由与生产安全三大挑战。通过将适配器 ID 外部化到 AWS Systems Manager Parameter Store,更新生产引用可实现零停机、无需重新部署应用,将原本耗时数小时或数天的协调工作缩短至数秒。
AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。
AWS 展示了如何在 SageMaker HyperPod 上运行开源 RL 框架 SkyRL,以 GRPO 算法训练 Qwen3-VL-8B 视觉语言模型导航视觉迷宫。
AWS 机器学习博客发布 NarrateAI 系列第二篇,详解在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。该系统为超过 4,000 名 AWS 高管提供商业智能服务,实测数值准确率约 99%,流式响应约 13 秒开始输出,相比顺序评估延迟降低 86.8%。
Qwen3-TTS-12Hz-1.7B-Base 现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点,支持从数秒参考音频克隆说话人音色,无需重新训练模型。
Datacor 将 Amazon Quick Sight 集成进 TrackAbout 解决方案,为工业气体与焊接分销商提供自助式租赁分析,用户可通过交互式仪表盘和自然语言搜索直接查询租赁绩效数据,无需再提交 IT 工单或等待定制报告。
AWS 推出 WhisperX 深度学习容器(DLC),将 OpenAI Whisper 与 wav2vec2 强制对齐及说话人分离结合,提供逐词时间戳和说话人标签。
亚马逊云科技发布参考架构,通过 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户 AI 智能体,让数据留在各业务账户本地,查询时仅流出所需数据。
Aderant 通过 Amazon Bedrock 使用 Amazon Nova Lite 构建了智能工单分析器,为法律行业业务管理软件的 SierraOps 团队自动化工单分类、路由和知识补充流程。该系统在生产前 2.5 周内审查了 109 个工单,路由准确率约 96%,预计每周节省 8-14 个工程小时,总运营成本低于每月 30 美元,其中 Bedrock 推理成本低于每月 1 美元。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
Remedy Entertainment 的《CONTROL Resonant》本周登陆 GeForce NOW 云游戏平台,终极会员可借 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪、NVIDIA Reflex 与最高 5K HDR。
NVIDIA 发布教程,讲解如何用 NVIDIA Warp 与 MuJoCo Warp(MJWarp)将 SO-101 机械臂场景从单世界 CPU 仿真迁移到最多 2048 个并行 GPU 环境。文章覆盖单世界校验、批量分配、容量调优与吞吐测量,并给出 pip install warp-lang 与 mujoco-warp 的安装入口。
推荐理由:原文给出从单世界 MuJoCo 迁移到 2048 并行 MJWarp 环境的完整步骤,读者可直接照做并复现吞吐测量。
荷兰零售商 HEMA 基于 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,通过 Model Context Protocol (MCP) 将分散知识整合为单一可信来源,并接入 HAL 聊天、Kiro、Claude 等日常工具。
GitHub Copilot 应用重构了 Pull Request 视图,以应对 2200 个文件、超百万行改动和 400 多条评论的极端场景。方案将文档高度拆分为确定性代码高度与动态块高度两个独立域,用单次空闲与滚动门控的测量通道替代逐块 ResizeObserver,并通过按身份而非像素的滚动锚定避免跳动。团队还构建了自主的变更、测量、改进循环,用真实信号自动定位性能问题。
推荐理由:原文拆解了超大 diff 渲染的虚拟化、测量调度与滚动锚定方案,读者可借鉴其工程取舍。
AWS 官方博客发布了一套基于 Strands Agents SDK、Amazon Bedrock、Rekognition 和 Transcribe 的智能体视频问答方案,用户可用自然语言查询视频内容。
AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。
推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
NVIDIA AI Day Singapore 于 9 月 22-23 日在新加坡莱佛士城会议中心举行,NVIDIA 与合作伙伴展示东南亚地区的 AI 突破。
GPT-6 改进了提示词缓存机制,实现更高的缓存命中率,并新增诊断工具、显式断点及控制选项,以降低延迟和成本。这些功能旨在帮助开发者更高效地管理缓存行为,优化 API 调用性能。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速开源包,新增智能体工作流和平台支持,帮助开发者更快构建、定制和部署机器人应用。
推荐理由:原文给出了 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持和生态伙伴落地案例,读者可据此判断它如何加速机器人开发。
Hugging Face 在 transformers 中加入对 GGUF 模型的高效运行支持,通过复用 ggml 的 Metal 内核,可在 Apple Silicon 上以熟悉的 from_pretrained 接口加载并生成。
推荐理由:原文给出了 GGUF 加载方式、性能对比和当前限制,读者可以据此判断在 transformers 里跑本地量化模型的可行性与适用场景。
NVIDIA 推出 DSX Ready 认证计划,用于对符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品进行资格认证。计划启动时包含电池储能系统(BESS)和冷却分配单元(CDU)两个类别,首批合格厂商包括 Hitachi Energy、LG Energy Solution、Tesla 以及 LG Electronics、LiquidStack、Vertiv。
埃及AI生态正从潜力走向规模化生产,NVIDIA在开罗举办活动展示其全栈AI方案。过去一年,NVIDIA深度学习学院在埃及的学习者数量增长超十倍;Hassan Allam Data Centers获许可建设数据中心,预计投资4亿美元。非洲一年内新增四座AI工厂,另有656兆瓦容量在建,Cassava Technologies等企业正推动本地化AI基础设施部署。
NVIDIA 提出 AI 安全本质是工程问题,需在智能体栈的每一层(模型、工具、运行时环境)落实可执行的安全边界、责任人与防护证据。NVIDIA 开源 OpenShell 安全运行时,在智能体触及范围之外强制策略并提供沙箱执行;Cisco DefenseClaw、JFrog 等合作伙伴正基于 OpenShell 构建治理与技能扫描层。
NVIDIA 在纽约气候周上展示了五家将 AI 融入清洁能源项目的公司。ThinkLabs AI 利用数字孪生和智能体,将电网互联申请评估时间从 30-45 天缩短至两分钟。
Hugging Face 发布 tokenizers v1 的候选版本,编码路径比 v0.23 快 3 到 30 倍,在 Apple M4 Max 上八线程扩展效率为线性扩展的 76%,且输出 token ID 与旧版完全一致。
推荐理由:原文给出了 v1 相比 v0.23 的编码提速幅度和实现原理,读者可据此判断升级收益与适用场景。
Pawprint Studio 的开放世界抓宠 RPG《Aniimo》本周登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck、Firefox 浏览器等设备上串流游玩。
GitHub 用 Copilot 将 Copilot 运行时从 TypeScript 重写为超过 80 万行生产 Rust,历时约 14.5 周,由一名开发者主导完成。重写采用组件级就地替换策略,性能提升数个数量级,并新增 C ABI 支持进程内嵌入。
推荐理由:原文给出了用 Copilot 自身完成大规模 Rust 重写的完整过程与数据,读者可据此评估 AI 辅助重写的可行性与工程方法。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,Qwen3-VL 吞吐量比 GB300 NVL72 最高提升 3.7 倍,DeepSeek-R1 最高提升 2.5 倍。GB300 NVL72 在 288 GPU 规模下实现 99% 扩展效率,软件优化带来最高 1.6 倍性能提升。Nebius 等 19 家合作伙伴也提交了结果。
推荐理由:原文给出 Vera Rubin NVL72 在 MLPerf 推理基准上的首秀成绩与对比数据,读者可据此评估新一代平台的推理性能与扩展效率。
OpenAI 介绍 ChatGPT Work 与 Codex 的分析功能,帮助团队了解 AI 使用情况与支出、识别培训需求,并将采用情况与业务成果关联起来。该功能旨在让企业量化 AI 投入的实际回报,从而更精准地优化部署策略。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定功率预算内最大化 AI 工厂的 token 吞吐。云服务商 Lambda 的首次验证显示,19 个节点在 85% 功率下比 16 个节点满功率多产出 24% 的集群 token 吞吐,性能每瓦提升 23%。
推荐理由:原文给出 DSX 平台在功率管理上的实测数据与首个商业部署,读者可据此评估 AI 工厂在固定功率预算下的提效空间。
NVIDIA 在 AI Infra Summit 上宣布 Vera Rubin 与 DSX 平台多项进展,包括与 Amazon Annapurna Labs 合作 NVHBM 技术、d-Matrix 集成 NVLink Fusion,以及 Emerald AI 与 Silicon Valley Power 的灵活负载项目。
推荐理由:原文汇总了 NVIDIA 在 AI Infra Summit 上围绕 Vera Rubin 与 DSX 平台的多项进展,读者可据此了解 AI 工厂在能效与吞吐上的最新优化方向。
Perplexity 已采用 GPT-6 Astra 处理通信撰写、软件变更及生产系统监控等端到端任务。相比早期模型,Perplexity 对 Astra 的检查频率大幅降低,表明其对该模型的自主能力信任度显著提升。
OpenAI 将存储系统 Habitat 从 Python 库演进为全球分布式平台,支撑 ChatGPT 超 10 亿用户与每秒 2200 万次请求。该平台面向大规模在线存储场景设计,是 OpenAI 基础设施扩展的关键一环。