Open WebUI v0.11.3 发布:新增无障碍模式、修复聊天分支与升级失败问题
Open WebUI v0.11.3 发布,新增无障碍模式,可在下拉菜单、模型选择器等界面高亮当前指向项与已选模型。修复聊天分支在重载后保持连接、数据库升级失败时明确报错等问题,并增强界面字体应用范围与印尼语翻译。
Open WebUI v0.11.3 发布,新增无障碍模式,可在下拉菜单、模型选择器等界面高亮当前指向项与已选模型。修复聊天分支在重载后保持连接、数据库升级失败时明确报错等问题,并增强界面字体应用范围与印尼语翻译。
Open WebUI v0.11.2 发布,为终端生成的 Word 文档和幻灯片提供成品级预览,并新增可点击的页码缩略图。未配置管道的部署不再为每条消息支付额外开销,多 worker 部署的模型列表刷新和 Redis 后端 websocket 服务器负载也显著降低。此版本还包含安全与访问控制修复,并建议生产环境尽快更新。
Open WebUI 发布 v0.11.1,新增人工审批工具调用功能,管理员开启后可在对话中逐次允许或拒绝模型使用工具;模型还可暂停并提问最多三个选择题。同时重构了流式传输,长回复数据传输量最高减少 1000 倍,并修复了知识库越权访问、文档解压炸弹等多项安全漏洞,建议生产环境尽快升级。
Gradio 发布内置的 gr.Workflow,让用户把多步 AI 流程描述为类型化节点图,Gradio 会提供可拖拽画布,每个节点可运行且中间结果可见。同一张图同时是 REST API,并支持一键部署到 Hugging Face Spaces。文中给出图像编辑、媒体工作室、并行生成、数据集分析等可复制的示例 Space。
推荐理由:原文展示了把多步 AI 流程变成可视化画布、REST API 和一键部署的具体用法,读者可据此判断它能否简化自己的管线搭建。
Hugging Face 在 Papers with Code 上构建了混合搜索系统,结合 PostgreSQL 全文检索与 pgvector 向量检索,并用 RRF 融合排序。
done-hub v1.23.18 发布,本次更新修复了 bedrock oai 相关问题。该版本已通过 GitHub Releases 提供下载。
Liquid AI 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在 GPU 上实现最高 3.18 倍吞吐提升,端侧最高 2.87 倍,且不改变输出质量。LFM2.5-2.6B 的函数调用延迟平均降低 57%,并已开源支持 llama.cpp 和 SGLang。
推荐理由:原文给出了三款草稿模型的加速数据和接入方式,读者可据此评估投机解码带来的实际收益。
亿田智能全资子公司甘肃亿算与Z公司签署《亿田算力中心项目建设合同》,合同总价款10亿元,其中设备采购8.32亿元、系统集成服务1.68亿元。甘肃亿算将委托乙方采购算力服务器及辅助设备并完成集群组网,面向市场提供智算算力和大模型应用技术支持服务。公司此前已审议通过以自有或自筹资金向多家供应商采购服务器及配套设备,总金额预计不超过20亿元。
Dharma AI 构建了约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权输出平均提升 52%。分配器将实时推理需求视为曲线而非峰值预留,按优先级跨整个时间轴放置批处理作业,并在 1 到 2 毫秒内完成调度。文章还介绍了训练、量化等负载的专用预测器,以及 24 小时优化、每 30 到 60 分钟重跑的机制。
推荐理由:原文给出了约束感知 GPU 分配器相对 FIFO 的实测收益和实现思路,读者可据此评估调度顺序优化对集群利用率的实际影响。
AWS 开源的 Strands Robots SDK 与 Hugging Face Storage Buckets 结合,实现从录制机器人演示、流式训练到部署策略的完整数据闭环。
推荐理由:原文演示了从录制、存储、流式训练到部署的完整数据闭环,读者可据此评估这套开源工作流是否适合自己的机器人数据采集场景。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 和融合分块 KL 损失,避免同时加载教师与学生模型,也无需物化完整的词表×序列长度矩阵。
推荐理由:原文给出了离线蒸馏和融合分块 KL 损失的实现与内存对比,读者可据此评估在单卡上做长上下文蒸馏的可行性。
Baseten 正式成为 Hugging Face Hub 上的 Inference Provider,支持对话和文本生成任务,可访问 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开源权重模型。
亿田智能全资子公司甘肃亿算与客户 Y 公司签署《算力资源服务合同》,含税金额 110,643.6 万元,按月度据实结算。合同服务期自每批次算力适配完成日起单独计算 60 个月,Y 公司资信良好且与公司无关联关系。本次合同金额占公司最近一个会计年度经审计主营业务收入 100% 以上,不构成关联交易及重大资产重组。
Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。
推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式模拟器。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上实现约 160 帧每秒的交互式运行,支持键盘、Meta Quest 控制器或学习策略闭环控制。
推荐理由:原文给出了从离线世界模型到实时交互模拟器的能力跃迁和具体帧率数字,读者可据此判断它在手术机器人训练与评估中的适用场景。
Hugging Face 宣布 Diffusers 现已原生支持 Nunchaku 4-bit 扩散推理,加载预量化 checkpoint 只需调用 from_pretrained(),无需本地 CUDA 编译。
推荐理由:官方博客说明 Nunchaku 4-bit 扩散推理已原生接入 Diffusers,读者可据此判断量化推理的落地方式与收益。
IBM Research 在博客中分享构建智能体路由器的经验,指出模型选择实际是系统优化问题。实测中 GPT-4.1 在 AppWorld 测试上成本是 Claude Sonnet 4.6 的近两倍,原因是缓存命中率差异;任务难度在路由时往往不可见,且需同时权衡成本、延迟、合规等多重因素。他们的优化算法在保持轻量(每任务约 6 ms、2 kB 内存)的同时,提供了成本、延迟、精度之间的可调操作点。
推荐理由:作者用实测数据拆解了路由优化的三个隐藏维度,读者可据此重新审视自家智能体系统的成本与延迟优化思路。
Hugging Face 发布 PyTorch 性能剖析系列第三篇,用 profiler 对比朴素注意力、原地掩码、SDPA 的 math、efficient、flash 和 cuDNN 后端。
推荐理由:用可复现脚本逐层对比注意力各实现的 profiler 足迹,能帮读者建立先猜测再验证的调优习惯。
Mistral Studio 今日起为 Prompts 和 Skills 提供系统化记录,实现版本管理、明确归属与全程可追溯。每个版本不可变,支持对比回滚,变更记录含操作者与时间,并通过标签分类和审计日志确保合规。资产可直接作为 MCP 服务器运行,结合可观测性追踪生产输出与版本关联,数据始终留在企业边界内。
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。
推荐理由:原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页一键点击“Customize on SageMaker AI”或“Deploy on SageMaker AI”,直接进入 SageMaker Studio 对应工作流,模型预载且环境自动配置。
微软在 Build 2026 上宣布 Foundry Managed Compute 支持 Hugging Face 模型,提供每周刷新的精选开源权重目录,可一键部署到托管 GPU 平台。
推荐理由:原文给出了模型目录、一键部署流程和运行时选型,读者可以据此评估在 Foundry 上托管开源模型的成本与运维方式。
SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出了 hf:// 挂载、零出口流量和 Xet 去重的具体机制与实测数字,读者可据此判断跨云训练的数据成本能省多少。
Hugging Face 发布 Kernels 项目重大更新,在 Hub 上引入新的 kernel 仓库类型,并默认只加载受信任发布者的内核,同时加入基于 Sigstore cosign 的代码签名机制。
推荐理由:原文梳理了内核仓库类型、签名验证和 CLI 重构等关键变化,读者可据此判断新内核工作流的安全边界与适配范围。
NVIDIA 推出 ENPIRE 框架,让实体机器人像 AI 智能体一样自主实验、试错与改进,在 PushT 等灵巧操作任务上实现 99% 成功率,但多机器人扩展仍面临基础设施挑战。犹他大学学者发文指出,人类对技术发展的预测历来糟糕,对 AI 影响持过度乐观或悲观态度都缺乏历史依据。
亚信安全控股子公司亚信科技拟与关联方宁夏西云算力签订《算力集群服务框架协议》,采购高性能GPU及存储算力资源及配套部署运维服务,协议金额上限3,000万元,有效期1年。该交易构成关联交易,已获董事会审议通过,无需提交股东会审议。公司提示,采购尚处投资建设阶段,若下游客户预算收缩或私有化模型落地不及预期,项目订单拓展及投资回报周期存在不确定性。
Kong 3.9.3 已发布,包含 11 个提交至 release/3.9.x 分支的更新。该版本现已提供 Docker 镜像下载,并附有完整的变更日志。
Apache APISIX 3.17.0 版本发布。该版本为开源 API 网关带来更新,用户可通过官方下载页面和归档页面获取源码。
加州大学圣迭戈分校在 Google 支持下,计划将退役 Pixel 手机的主板提取并组成集群,部署一个由 2000 部手机组成的数据中心,为数百名研究人员和学生提供低成本、低碳的云计算服务。早期实验显示,20 部手机组成的集群即可支持 75 人以上班级的峰值提交,延迟低于 AWS 默认后端;该系统预计于 2026 年秋季上线。
推荐理由:原文给出了旧手机集群的计算能力对比和部署计划,读者可以据此评估这种低碳算力方案的可行性。
Mistral 宣布推出物理 AI,将 Emmi AI 纳入其企业解决方案,用于 AI 原生工业工程。物理 AI 从求解器输出中学习,在单张 GPU 上数秒内完成正向预测,适用于航空航天、汽车、半导体、能源等领域,并与 ASML、Airbus、Safran、Siemens Energy 等伙伴合作。传统求解器仍用于验证和边缘情况。
推荐理由:原文解释了物理 AI 与传统求解器的分工,以及它在产品设计、制造和数字孪生上的加速价值,可据此判断其适用场景。
Mistral 收购 Emmi AI,专注为航空航天、汽车、半导体和能源等行业构建基础物理 AI。相关成果包括用于跨声速 3D 机翼 CFD 模拟的约 30,000 个样本数据集、AB-UPT 模型(单 GPU 可处理 9M 表面和 140M 体积单元),以及 NeuralDEM 等实时工业过程仿真工具。
Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。
推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。
Mistral AI 发布 Workflows 编排层公开预览,为 AI 流程提供持久执行、可观测性和人工审批,支持从概念验证到生产环境的可靠运行。Workflows 是 Studio 的一部分,开发者用 Python 编写流程后可发布到 Le Chat 供组织内触发,每一步在 Studio 中可追踪审计。
推荐理由:原文给出了编排层的核心能力、部署模型和真实客户案例,读者可据此判断它如何把 AI 流程从概念验证推进到生产。
Google DeepMind 发布新论文,提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛,通过异步数据流隔离局部故障,使系统在硬件故障时仍能保持高可用性。实测中,该架构用 2-5 Gbps 带宽在四个美国区域成功训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持混用 TPU v6e 和 TPU v5p 等不同代际硬件。
推荐理由:原文给出了跨数据中心训练的新架构及其在带宽、容错和硬件混用上的实测结果,读者可据此评估分布式训练的新路径。
GRASP 是一种面向学习型动力学(世界模型)的新型梯度规划器,通过将轨迹提升至虚拟状态实现跨时间并行优化、直接向状态迭代添加随机性以增强探索,并重塑梯度以避免高维视觉模型中的脆弱“状态输入”梯度,使长视野规划变得实用。
Apache APISIX 3.16.0 版本发布。官方提醒 GitHub 并非正式发布或归档区域,用户应从官方下载页面和归档页面获取源代码。
Mistral AI 发布 Spaces CLI,一个面向人类开发者和编码智能体的命令行工具,可用三条命令完成项目脚手架、开发环境启动和部署。其核心设计原则是每个交互输入都有对应的 flag 等价物、每个 flag 都有无头模式下的智能默认值、状态显式化,并通过生成 context.json 和 AGENTS.md 文件帮助智能体理解项目。
推荐理由:Mistral 公开了 Spaces CLI 的完整设计原则,读者可借鉴其让 CLI 同时服务人类与智能体的具体做法。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 XR Blocks 框架,将自然语言直接转化为带物理感知的 Android XR 应用,生成时间在 60 秒内。
推荐理由:原文给出了从自然语言到可运行 XR 应用的完整流程和实测成功率,读者可据此评估该工作流的成熟度与上手成本。
Google Research 推出压缩算法 TurboQuant,通过结合 PolarQuant 与 QJL 技术,在实现高压缩率的同时保持零精度损失,旨在解决向量量化中的内存开销问题,并缓解 KV 缓存瓶颈。
Apache APISIX 3.15.0 版本发布。该版本为开源 API 网关带来更新,用户可通过官方下载页面获取源码,GitHub 仅用于版本对比,不提供正式发布包或归档。