跳到正文

#部署/工程

今日 4 条
9月10日周四
  1. Mistral AI33

    Cloudera 与 Mistral 达成合作,为企业数据带来专业化主权智能

    Cloudera 与 Mistral 宣布建立新合作伙伴关系,将 Mistral 模型集成到 Cloudera 的混合数据平台中,使企业能够在私有云、公共云、本地及完全隔离(air-gapped)环境中部署 AI 模型并保持完全控制。企业还可利用专有数据在受控环境中训练定制模型,保留数据和智能的所有权。该合作旨在满足对主权 AI 日益增长的需求,让数据、智能、计算和运营始终处于客户控制之下。

  2. Hugging Face Blog78

    AsyncGRPOTrainer 结合 LoRA 跨 HF Jobs 训练:用存储桶同步适配器,无需 NCCL

    Hugging Face 博客介绍如何用 AsyncGRPOTrainer 结合 LoRA 在 HF Jobs 上跨节点训练,通过 Storage Bucket 同步适配器而非 NCCL,并用代理路由请求。500 步训练从 3 小时 27 分钟优化到 53 分钟,速度提升 3.9 倍,代码已开源。

    推荐理由:原文给出了完整的架构、代码和调优过程,读者可以据此复现跨节点 LoRA 异步强化学习训练。

9月3日周四
9月1日周二
  1. Hugging Face Blog73

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核加速本地 AI 推理

    Hugging Face 发布 @huggingface/kernels,一个用于从 Hub 加载和运行优化 WebGPU 内核的库,并推出 207 个内核的初始集合,Apache-2.0 许可。在 Apple M4 GPU 上与 ORT WebGPU 对比,几何平均快 2.57 倍,中位数快 1.90 倍。同时推出 Fleet 浏览器基准测试套件,用于众包收集真实 GPU 上的正确性和性能证据。

    推荐理由:原文给出了 207 个 WebGPU 内核的发布、性能对比数据和开源许可,读者可据此评估浏览器端推理的加速空间。

8月25日周二
  1. Hugging Face Blog62

    Gradio 推出 gr.Workflow,把 AI 流程变成可视化画布与 REST API

    Gradio 发布内置的 gr.Workflow,让用户把多步 AI 流程描述为类型化节点图,Gradio 会提供可拖拽画布,每个节点可运行且中间结果可见。同一张图同时是 REST API,并支持一键部署到 Hugging Face Spaces。文中给出图像编辑、媒体工作室、并行生成、数据集分析等可复制的示例 Space。

    推荐理由:原文展示了把多步 AI 流程变成可视化画布、REST API 和一键部署的具体用法,读者可据此判断它能否简化自己的管线搭建。

8月21日周五
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理速度最高提升 3.18 倍

    Liquid AI 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在 GPU 上实现最高 3.18 倍吞吐提升,端侧最高 2.87 倍,且不改变输出质量。LFM2.5-2.6B 的函数调用延迟平均降低 57%,并已开源支持 llama.cpp 和 SGLang。

    推荐理由:原文给出了三款草稿模型的加速数据和接入方式,读者可据此评估投机解码带来的实际收益。

8月18日周二
  1. Hugging Face Blog62

    Dharma AI 发布约束感知 GPU 分配器:同集群利用率提升 33 个百分点

    Dharma AI 构建了约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权输出平均提升 52%。分配器将实时推理需求视为曲线而非峰值预留,按优先级跨整个时间轴放置批处理作业,并在 1 到 2 毫秒内完成调度。文章还介绍了训练、量化等负载的专用预测器,以及 24 小时优化、每 30 到 60 分钟重跑的机制。

    推荐理由:原文给出了约束感知 GPU 分配器相对 FIFO 的实测收益和实现思路,读者可据此评估调度顺序优化对集群利用率的实际影响。

8月14日周五
  1. Hugging Face Blog62

    Strands Robots 与 Hugging Face Storage Buckets 实现录制、训练、部署一体化数据闭环

    AWS 开源的 Strands Robots SDK 与 Hugging Face Storage Buckets 结合,实现从录制机器人演示、流式训练到部署策略的完整数据闭环。

    推荐理由:原文演示了从录制、存储、流式训练到部署的完整数据闭环,读者可据此评估这套开源工作流是否适合自己的机器人数据采集场景。

8月10日周一
  1. Hugging Face Blog62

    Multiverse Computing 提出高效知识蒸馏方法,将长上下文蒸馏压缩到单 GPU 可运行

    Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 和融合分块 KL 损失,避免同时加载教师与学生模型,也无需物化完整的词表×序列长度矩阵。

    推荐理由:原文给出了离线蒸馏和融合分块 KL 损失的实现与内存对比,读者可据此评估在单卡上做长上下文蒸馏的可行性。

8月6日周四
7月29日周三
  1. Berkeley AI Research70

    K-Search 将 CUDA 内核优化经验迁移到 Apple Silicon,注意力内核达 0.97x 原生性能

    Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。

    推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。

7月27日周一
  1. Hugging Face Blog62

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式模拟器

    NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式模拟器。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上实现约 160 帧每秒的交互式运行,支持键盘、Meta Quest 控制器或学习策略闭环控制。

    推荐理由:原文给出了从离线世界模型到实时交互模拟器的能力跃迁和具体帧率数字,读者可据此判断它在手术机器人训练与评估中的适用场景。

7月23日周四
7月16日周四
  1. Hugging Face Blog62

    IBM Research:模型路由看似简单,实则是系统优化问题

    IBM Research 在博客中分享构建智能体路由器的经验,指出模型选择实际是系统优化问题。实测中 GPT-4.1 在 AppWorld 测试上成本是 Claude Sonnet 4.6 的近两倍,原因是缓存命中率差异;任务难度在路由时往往不可见,且需同时权衡成本、延迟、合规等多重因素。他们的优化算法在保持轻量(每任务约 6 ms、2 kB 内存)的同时,提供了成本、延迟、精度之间的可调操作点。

    推荐理由:作者用实测数据拆解了路由优化的三个隐藏维度,读者可据此重新审视自家智能体系统的成本与延迟优化思路。

7月10日周五
7月9日周四
  1. Mistral AI50

    Mistral Studio 为 Prompts 和 Skills 提供系统化记录

    Mistral Studio 今日起为 Prompts 和 Skills 提供系统化记录,实现版本管理、明确归属与全程可追溯。每个版本不可变,支持对比回滚,变更记录含操作者与时间,并通过标签分类和审计日志确保合规。资产可直接作为 MCP 服务器运行,结合可观测性追踪生产输出与版本关联,数据始终留在企业边界内。

7月8日周三
  1. Hugging Face Blog75

    vLLM transformers 建模后端提速至原生速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。

    推荐理由:原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。

7月7日周二
  1. Hugging Face Blog78

    SkyPilot 与 Hugging Face 联合推出零出口流量存储,跨云训练直接挂载 Hub 数据

    SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。

    推荐理由:原文给出了 hf:// 挂载、零出口流量和 Xet 去重的具体机制与实测数字,读者可据此判断跨云训练的数据成本能省多少。

7月6日周一
  1. Hugging Face Blog62

    Hugging Face 重构 Kernels 项目:新增内核仓库类型、代码签名与智能体开发支持

    Hugging Face 发布 Kernels 项目重大更新,在 Hub 上引入新的 kernel 仓库类型,并默认只加载受信任发布者的内核,同时加入基于 Sigstore cosign 的代码签名机制。

    推荐理由:原文梳理了内核仓库类型、签名验证和 CLI 重构等关键变化,读者可据此判断新内核工作流的安全边界与适配范围。

6月13日周六
  1. Google Research62

    加州大学圣迭戈分校计划用 2000 部旧 Pixel 手机搭建低碳云计算平台

    加州大学圣迭戈分校在 Google 支持下,计划将退役 Pixel 手机的主板提取并组成集群,部署一个由 2000 部手机组成的数据中心,为数百名研究人员和学生提供低成本、低碳的云计算服务。早期实验显示,20 部手机组成的集群即可支持 75 人以上班级的峰值提交,延迟低于 AWS 默认后端;该系统预计于 2026 年秋季上线。

    推荐理由:原文给出了旧手机集群的计算能力对比和部署计划,读者可以据此评估这种低碳算力方案的可行性。

5月27日周三
  1. Mistral AI60

    Mistral 推出物理 AI,将 Emmi AI 纳入企业平台

    Mistral 宣布推出物理 AI,将 Emmi AI 纳入其企业解决方案,用于 AI 原生工业工程。物理 AI 从求解器输出中学习,在单张 GPU 上数秒内完成正向预测,适用于航空航天、汽车、半导体、能源等领域,并与 ASML、Airbus、Safran、Siemens Energy 等伙伴合作。传统求解器仍用于验证和边缘情况。

    推荐理由:原文解释了物理 AI 与传统求解器的分工,以及它在产品设计、制造和数字孪生上的加速价值,可据此判断其适用场景。

5月8日周五
  1. Berkeley AI Research62

    自适应并行推理:高效推理扩展的下一个范式

    Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。

    推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。

4月27日周一
  1. Mistral AI73

    Mistral AI 发布 Workflows 编排层公开预览

    Mistral AI 发布 Workflows 编排层公开预览,为 AI 流程提供持久执行、可观测性和人工审批,支持从概念验证到生产环境的可靠运行。Workflows 是 Studio 的一部分,开发者用 Python 编写流程后可发布到 Le Chat 供组织内触发,每一步在 Studio 中可追踪审计。

    推荐理由:原文给出了编排层的核心能力、部署模型和真实客户案例,读者可据此判断它如何把 AI 流程从概念验证推进到生产。

4月22日周三
  1. Google DeepMind70

    Google DeepMind 发布 Decoupled DiLoCo 架构,实现跨数据中心低带宽容错训练

    Google DeepMind 发布新论文,提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛,通过异步数据流隔离局部故障,使系统在硬件故障时仍能保持高可用性。实测中,该架构用 2-5 Gbps 带宽在四个美国区域成功训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持混用 TPU v6e 和 TPU v5p 等不同代际硬件。

    推荐理由:原文给出了跨数据中心训练的新架构及其在带宽、容错和硬件混用上的实测结果,读者可据此评估分布式训练的新路径。

4月20日周一
3月31日周二
  1. Mistral AI62

    Mistral AI 发布 Spaces CLI,面向人类开发者与编码智能体

    Mistral AI 发布 Spaces CLI,一个面向人类开发者和编码智能体的命令行工具,可用三条命令完成项目脚手架、开发环境启动和部署。其核心设计原则是每个交互输入都有对应的 flag 等价物、每个 flag 都有无头模式下的智能默认值、状态显式化,并通过生成 context.json 和 AGENTS.md 文件帮助智能体理解项目。

    推荐理由:Mistral 公开了 Spaces CLI 的完整设计原则,读者可借鉴其让 CLI 同时服务人类与智能体的具体做法。

3月25日周三
  1. Google Research62

    Google 发布 Vibe Coding XR:用 Gemini 在 60 秒内生成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 XR Blocks 框架,将自然语言直接转化为带物理感知的 Android XR 应用,生成时间在 60 秒内。

    推荐理由:原文给出了从自然语言到可运行 XR 应用的完整流程和实测成功率,读者可据此评估该工作流的成熟度与上手成本。

1月22日周四
  1. Mistral AI62

    Mistral AI 复盘 vLLM 内存泄漏排查:从 Heaptrack 到 GDB 定位 UCX 根因

    Mistral AI 发布工程深度复盘,记录其在 vLLM 预填充/解码分离部署中排查内存泄漏的过程。问题表现为生产流量下系统内存以每分钟 400 MB 线性增长,最终通过 pmap、BPFtrace 和 GDB 定位到 UCX 的 mmap 钩子机制导致匿名内存区域持续增长。设置 UCX_MEM_MMAP_HOOK_MODE=none 即可解决,相关修复已合并进 vLLM 仓库。

    推荐理由:Mistral AI 完整复盘了 vLLM 内存泄漏的排查链路,从 Heaptrack 到 BPFtrace 再到 GDB,读者可复用这套方法论定位依赖层隐藏问题。

10月24日周五
  1. Mistral AI60

    Mistral AI 发布 AI Studio 企业生产平台

    Mistral AI 发布 AI Studio,面向企业团队提供从原型到生产的 AI 平台,核心由可观测性、Agent Runtime 和 AI Registry 三根支柱构成。平台支持混合云、专有和自托管部署,内置评估、反馈闭环、版本追踪与治理能力,现已开放私有测试报名。

    推荐理由:原文把企业 AI 从原型到生产的瓶颈拆成可观测、可执行、可治理三根支柱,读者可据此对照自身团队的落地缺口。

8月1日周五
6月11日周三