跳到正文

#部署/工程

今日 5 条
今天9月29日周二
  1. AWS Machine Learning Blog70

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度

    xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。

    推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。

  2. Microsoft Research18

    微软亚洲研究院(新加坡)成立一周年:推进研究、合作与人才培养

    微软亚洲研究院(新加坡)迎来成立一周年。该实验室于2025年7月24日启用,是微软在东南亚的首个研究实验室,聚焦下一代AI模型与智能体系统、领域特定AI、AI原生研究实践及生态与人才发展四大支柱。其研究通过医疗、金融、教育等领域的合作推动现实应用,并与新加坡经济发展局等机构建立了战略合作。

9月28日周一
  1. Mistral AI38

    Mistral 在慕尼黑开设德国中心,推进欧洲工业 AI

    Mistral 在慕尼黑开设新中心,聚焦 Physics AI 与工业 AI,并直接服务企业合作伙伴。该中心将组建 Physics AI 和工业 AI 专项研究团队,并与宝马、西门子能源及慕尼黑工业大学合作。Mistral 计划到 2030 年建成 1 吉瓦欧洲算力,其开放权重架构支持模型在客户自有基础设施上运行,数据不离开组织。

  2. AWS Machine Learning Blog38

    跨账户自动化管理 Amazon Textract 适配器生命周期

    AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的解决方案,涵盖适配器提升、文档路由与生产安全三大挑战。通过将适配器 ID 外部化到 AWS Systems Manager Parameter Store,更新生产引用可实现零停机、无需重新部署应用,将原本耗时数小时或数天的协调工作缩短至数秒。

  3. The Decoder62

    英伟达推出内置芯片的智能体看门狗 Sentry

    英伟达推出智能体安全看门狗 Sentry,作为 BlueField-4 DPU 的参考设计,与主计算分离运行,可在智能体试图越界时于毫秒内隔离。Sentry 结合 3 月开源的 OpenShell 沙箱和 9 月 10 日推出的形式化验证工具,用于检测权限是否越限。英伟达称兼容系统只需软件更新即可启用,但未公布独立上市日期,也未给出检测可靠性数据。

  4. Simon Willison40

    Bluesky 回复机器人检测工具

    针对 Bluesky 上日益增多的自动回复机器人,Simon Willison 用 Opus 5.5 通过 vibe coding 开发了一款检测工具。该工具通过分析账户回复速度、是否从不发布原创内容以及回复中是否含问号等信号,识别疑似回复机器人。Bluesky 仍提供免费可用的 API,使这类调查成为可能。

9月26日周六
  1. AWS Machine Learning Blog38

    AWS 如何用 EKS、EFA 与 DeepEP 将 MoE 强化学习吞吐提升 40%

    AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。

  2. AWS Machine Learning Blog57

    NarrateAI 在 Amazon Bedrock 上的生产级 LLM 质量保障实践

    AWS 机器学习博客发布 NarrateAI 系列第二篇,详解在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。该系统为超过 4,000 名 AWS 高管提供商业智能服务,实测数值准确率约 99%,流式响应约 13 秒开始输出,相比顺序评估延迟降低 86.8%。

9月25日周五
  1. AWS Machine Learning Blog38

    Aderant 用 Amazon Nova 构建智能工单分类系统

    Aderant 通过 Amazon Bedrock 使用 Amazon Nova Lite 构建了智能工单分析器,为法律行业业务管理软件的 SierraOps 团队自动化工单分类、路由和知识补充流程。该系统在生产前 2.5 周内审查了 109 个工单,路由准确率约 96%,预计每周节省 8-14 个工程小时,总运营成本低于每月 30 美元,其中 Bedrock 推理成本低于每月 1 美元。

  2. 巨潮公告 · 智算中心23

    光环新网对和林格尔智算中心项目追加投资至25亿元,IT负载提升至90-120MW

    光环新网拟对和林格尔智算中心项目追加投资至25.00亿元,较原规划增加12.65亿元,增幅102.43%。调整后项目IT负载由60-100MW提升至90-120MW,总建筑面积增至约12.12万平方米,机柜规模扩至7,000-10,000个,设计PUE降至<1.2。项目满负载运营后预计年营业收入7.22亿元,净利润1.11亿元。

  3. 巨潮公告 · 智算中心18

    光环新网对和林格尔智算中心项目追加投资12.65亿元

    光环新网董事会审议通过,对和林格尔智算中心项目追加投资不超过12.65亿元,总投资额增至约25.00亿元。调整后项目IT负载产能由60-100MW提升至90-120MW,可部署7,000-10,000个2N 12-16KW标准机柜,设计PUE<1.2,满负荷年净利润预计增至11,132.45万元。追加投资源于AI大模型训练与推理需求进入规模化商用期,北方区域智算算力需求持续增长。

9月24日周四
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,加速视觉语言模型推理

    Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。

    推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。

  2. Hugging Face Blog62

    NVIDIA 教程:用 Warp 与 MJWarp 将 MuJoCo 机器人仿真扩展到 2048 并行环境

    NVIDIA 发布教程,讲解如何用 NVIDIA Warp 与 MuJoCo Warp(MJWarp)将 SO-101 机械臂场景从单世界 CPU 仿真迁移到最多 2048 个并行 GPU 环境。文章覆盖单世界校验、批量分配、容量调优与吞吐测量,并给出 pip install warp-lang 与 mujoco-warp 的安装入口。

    推荐理由:原文给出从单世界 MuJoCo 迁移到 2048 并行 MJWarp 环境的完整步骤,读者可直接照做并复现吞吐测量。

  3. GitHub Blog · AI & ML60

    GitHub Copilot 应用如何渲染超大 Pull Request

    GitHub Copilot 应用重构了 Pull Request 视图,以应对 2200 个文件、超百万行改动和 400 多条评论的极端场景。方案将文档高度拆分为确定性代码高度与动态块高度两个独立域,用单次空闲与滚动门控的测量通道替代逐块 ResizeObserver,并通过按身份而非像素的滚动锚定避免跳动。团队还构建了自主的变更、测量、改进循环,用真实信号自动定位性能问题。

    推荐理由:原文拆解了超大 diff 渲染的虚拟化、测量调度与滚动锚定方案,读者可借鉴其工程取舍。

  4. AWS Machine Learning Blog62

    AWS 教程:用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体

    AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。

    推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。

  5. Microsoft Research68

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。

    推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。

9月23日周三
  1. 巨潮公告 · 算力服务18

    行云科技签订43套GPU算力服务重大合同,含税总额45,313.98万元

    行云科技与某国资供应商签署3份《算力服务合同》,购买GPU算力服务合计43套,服务期限均为5年,含税总金额45,313.98万元,系此前128套框架性采购协议项下进展。合同约定5年期满后双方续约3年,续约期间净利润70%归公司、30%为供应商服务费。公司提示供货交付延期、算力贬值及高额违约赔付等风险。

9月22日周二
  1. NVIDIA Blog62

    NVIDIA Isaac ROS 5.0 发布,引入智能体工作流并支持 ROS Lyrical

    NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速开源包,新增智能体工作流和平台支持,帮助开发者更快构建、定制和部署机器人应用。

    推荐理由:原文给出了 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持和生态伙伴落地案例,读者可据此判断它如何加速机器人开发。

  2. Hugging Face Blog73

    Hugging Face transformers 支持运行 llama.cpp 的 GGUF 量化模型

    Hugging Face 在 transformers 中加入对 GGUF 模型的高效运行支持,通过复用 ggml 的 Metal 内核,可在 Apple Silicon 上以熟悉的 from_pretrained 接口加载并生成。

    推荐理由:原文给出了 GGUF 加载方式、性能对比和当前限制,读者可以据此判断在 transformers 里跑本地量化模型的可行性与适用场景。

  3. NVIDIA Blog33

    从赋能到落地,埃及AI生态迈向生产规模

    埃及AI生态正从潜力走向规模化生产,NVIDIA在开罗举办活动展示其全栈AI方案。过去一年,NVIDIA深度学习学院在埃及的学习者数量增长超十倍;Hassan Allam Data Centers获许可建设数据中心,预计投资4亿美元。非洲一年内新增四座AI工厂,另有656兆瓦容量在建,Cassava Technologies等企业正推动本地化AI基础设施部署。

9月21日周一
  1. NVIDIA Blog42

    AI 安全是工程问题:NVIDIA 如何在智能体栈每一层解决它

    NVIDIA 提出 AI 安全本质是工程问题,需在智能体栈的每一层(模型、工具、运行时环境)落实可执行的安全边界、责任人与防护证据。NVIDIA 开源 OpenShell 安全运行时,在智能体触及范围之外强制策略并提供沙箱执行;Cisco DefenseClaw、JFrog 等合作伙伴正基于 OpenShell 构建治理与技能扫描层。