Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
微软亚洲研究院(新加坡)迎来成立一周年。该实验室于2025年7月24日启用,是微软在东南亚的首个研究实验室,聚焦下一代AI模型与智能体系统、领域特定AI、AI原生研究实践及生态与人才发展四大支柱。其研究通过医疗、金融、教育等领域的合作推动现实应用,并与新加坡经济发展局等机构建立了战略合作。
Nvidia 在周一发布 Open Agent Safety Platform,通过 OpenShell 软件边界与运行在 BlueField-4 上的 Sentry 监控系统,为 AI 智能体提供独立于 CPU/GPU 的硬件级安全层,可在毫秒内隔离越界行为。该平台已获 Anthropic、Arm、Microsoft、Oracle、SpaceX 等多家公司支持,OpenAI 未在参与名单中。
AWS 发布教程,演示如何在 SageMaker AI 上通过 vLLM-Omni DLC 部署 Qwen3-TTS 模型,实现文本流式输入和音频流式输出的双向实时语音应用。
本文展示如何在 Amazon SageMaker AI 上部署两个基于同一 AWS vLLM-Omni DLC 的端点:实时端点运行 FLUX.2-klein-4B 生成图像,异步端点运行 Wan2.1-VACE-1.3B 将图像动画化为短视频。
Mistral 在慕尼黑开设新中心,聚焦 Physics AI 与工业 AI,并直接服务企业合作伙伴。该中心将组建 Physics AI 和工业 AI 专项研究团队,并与宝马、西门子能源及慕尼黑工业大学合作。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重架构支持模型在客户自有基础设施上运行,数据不离开组织。
Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,以自然语言指令驱动浏览器工作流,在早期企业用例中对浏览器工作流准确率超过 90%。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的解决方案,涵盖适配器提升、文档路由与生产安全三大挑战。通过将适配器 ID 外部化到 AWS Systems Manager Parameter Store,更新生产引用可实现零停机、无需重新部署应用,将原本耗时数小时或数天的协调工作缩短至数秒。
英伟达推出智能体安全看门狗 Sentry,作为 BlueField-4 DPU 的参考设计,与主计算分离运行,可在智能体试图越界时于毫秒内隔离。Sentry 结合 3 月开源的 OpenShell 沙箱和 9 月 10 日推出的形式化验证工具,用于检测权限是否越限。英伟达称兼容系统只需软件更新即可启用,但未公布独立上市日期,也未给出检测可靠性数据。
gpt-load 发布 v2.0.0-rc.37,新增 Mistral 原生路由支持,并修复了 bifrost 协议下 provider base URL 语义不一致的问题。2.x 为全新重写版本,与 1.x 数据不兼容,需使用全新数据库和新的 encryption.key 部署。
LiteLLM v1.104.0-rc.1 发布,所有 Docker 镜像均使用 cosign 签名,并支持通过固定提交哈希或发布标签进行签名验证。该版本还包含多项修复,如 Azure code_interpreter 容器文件测试覆盖、预算 Redis 管道同步读取修复,以及将 SDK 回调迁移至 Langfuse v4。
LiteLLM v1.103.0 发布,所有 Docker 镜像均使用 cosign 签名,并支持通过固定 commit hash 或 release tag 进行签名验证。
Apache APISIX 发布 3.19.0 版本,由 shreemaan-abhishek 于 9 月 28 日发布。该版本包含多项更新,具体变更内容需查看标签对比或发布说明。
针对 Bluesky 上日益增多的自动回复机器人,Simon Willison 用 Opus 5.5 通过 vibe coding 开发了一款检测工具。该工具通过分析账户回复速度、是否从不发布原创内容以及回复中是否含问号等信号,识别疑似回复机器人。Bluesky 仍提供免费可用的 API,使这类调查成为可能。
AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。
AWS 展示了如何在 SageMaker HyperPod 上运行开源 RL 框架 SkyRL,以 GRPO 算法训练 Qwen3-VL-8B 视觉语言模型导航视觉迷宫。
AWS 机器学习博客发布 NarrateAI 系列第二篇,详解在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。该系统为超过 4,000 名 AWS 高管提供商业智能服务,实测数值准确率约 99%,流式响应约 13 秒开始输出,相比顺序评估延迟降低 86.8%。
Qwen3-TTS-12Hz-1.7B-Base 现可通过 Amazon SageMaker JumpStart 部署到全托管实时推理端点,支持从数秒参考音频克隆说话人音色,无需重新训练模型。
Datacor 将 Amazon Quick Sight 集成进 TrackAbout 解决方案,为工业气体与焊接分销商提供自助式租赁分析,用户可通过交互式仪表盘和自然语言搜索直接查询租赁绩效数据,无需再提交 IT 工单或等待定制报告。
AWS 推出 WhisperX 深度学习容器(DLC),将 OpenAI Whisper 与 wav2vec2 强制对齐及说话人分离结合,提供逐词时间戳和说话人标签。
亚马逊云科技发布参考架构,通过 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户 AI 智能体,让数据留在各业务账户本地,查询时仅流出所需数据。
Aderant 通过 Amazon Bedrock 使用 Amazon Nova Lite 构建了智能工单分析器,为法律行业业务管理软件的 SierraOps 团队自动化工单分类、路由和知识补充流程。该系统在生产前 2.5 周内审查了 109 个工单,路由准确率约 96%,预计每周节省 8-14 个工程小时,总运营成本低于每月 30 美元,其中 Bedrock 推理成本低于每月 1 美元。
光环新网拟对和林格尔智算中心项目追加投资至25.00亿元,较原规划增加12.65亿元,增幅102.43%。调整后项目IT负载由60-100MW提升至90-120MW,总建筑面积增至约12.12万平方米,机柜规模扩至7,000-10,000个,设计PUE降至<1.2。项目满负载运营后预计年营业收入7.22亿元,净利润1.11亿元。
光环新网董事会审议通过,对和林格尔智算中心项目追加投资不超过12.65亿元,总投资额增至约25.00亿元。调整后项目IT负载产能由60-100MW提升至90-120MW,可部署7,000-10,000个2N 12-16KW标准机柜,设计PUE<1.2,满负荷年净利润预计增至11,132.45万元。追加投资源于AI大模型训练与推理需求进入规模化商用期,北方区域智算算力需求持续增长。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
Remedy Entertainment 的《CONTROL Resonant》本周登陆 GeForce NOW 云游戏平台,终极会员可借 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪、NVIDIA Reflex 与最高 5K HDR。
NVIDIA 发布教程,讲解如何用 NVIDIA Warp 与 MuJoCo Warp(MJWarp)将 SO-101 机械臂场景从单世界 CPU 仿真迁移到最多 2048 个并行 GPU 环境。文章覆盖单世界校验、批量分配、容量调优与吞吐测量,并给出 pip install warp-lang 与 mujoco-warp 的安装入口。
推荐理由:原文给出从单世界 MuJoCo 迁移到 2048 并行 MJWarp 环境的完整步骤,读者可直接照做并复现吞吐测量。
荷兰零售商 HEMA 基于 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL,通过 Model Context Protocol (MCP) 将分散知识整合为单一可信来源,并接入 HAL 聊天、Kiro、Claude 等日常工具。
GitHub Copilot 应用重构了 Pull Request 视图,以应对 2200 个文件、超百万行改动和 400 多条评论的极端场景。方案将文档高度拆分为确定性代码高度与动态块高度两个独立域,用单次空闲与滚动门控的测量通道替代逐块 ResizeObserver,并通过按身份而非像素的滚动锚定避免跳动。团队还构建了自主的变更、测量、改进循环,用真实信号自动定位性能问题。
推荐理由:原文拆解了超大 diff 渲染的虚拟化、测量调度与滚动锚定方案,读者可借鉴其工程取舍。
AWS 官方博客发布了一套基于 Strands Agents SDK、Amazon Bedrock、Rekognition 和 Transcribe 的智能体视频问答方案,用户可用自然语言查询视频内容。
AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。
推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
NVIDIA AI Day Singapore 于 9 月 22-23 日在新加坡莱佛士城会议中心举行,NVIDIA 与合作伙伴展示东南亚地区的 AI 突破。
行云科技与某国资供应商签署3份《算力服务合同》,购买GPU算力服务合计43套,服务期限均为5年,含税总金额45,313.98万元,系此前128套框架性采购协议项下进展。合同约定5年期满后双方续约3年,续约期间净利润70%归公司、30%为供应商服务费。公司提示供货交付延期、算力贬值及高额违约赔付等风险。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速开源包,新增智能体工作流和平台支持,帮助开发者更快构建、定制和部署机器人应用。
推荐理由:原文给出了 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持和生态伙伴落地案例,读者可据此判断它如何加速机器人开发。
Hugging Face 在 transformers 中加入对 GGUF 模型的高效运行支持,通过复用 ggml 的 Metal 内核,可在 Apple Silicon 上以熟悉的 from_pretrained 接口加载并生成。
推荐理由:原文给出了 GGUF 加载方式、性能对比和当前限制,读者可以据此判断在 transformers 里跑本地量化模型的可行性与适用场景。
NVIDIA 推出 DSX Ready 认证计划,用于对符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品进行资格认证。计划启动时包含电池储能系统(BESS)和冷却分配单元(CDU)两个类别,首批合格厂商包括 Hitachi Energy、LG Energy Solution、Tesla 以及 LG Electronics、LiquidStack、Vertiv。
埃及AI生态正从潜力走向规模化生产,NVIDIA在开罗举办活动展示其全栈AI方案。过去一年,NVIDIA深度学习学院在埃及的学习者数量增长超十倍;Hassan Allam Data Centers获许可建设数据中心,预计投资4亿美元。非洲一年内新增四座AI工厂,另有656兆瓦容量在建,Cassava Technologies等企业正推动本地化AI基础设施部署。
NVIDIA 提出 AI 安全本质是工程问题,需在智能体栈的每一层(模型、工具、运行时环境)落实可执行的安全边界、责任人与防护证据。NVIDIA 开源 OpenShell 安全运行时,在智能体触及范围之外强制策略并提供沙箱执行;Cisco DefenseClaw、JFrog 等合作伙伴正基于 OpenShell 构建治理与技能扫描层。
NVIDIA 在纽约气候周上展示了五家将 AI 融入清洁能源项目的公司。ThinkLabs AI 利用数字孪生和智能体,将电网互联申请评估时间从 30-45 天缩短至两分钟。