跳到正文

全部动态

今日 6 条
7月30日周四
  1. Google DeepMind55

    Google DeepMind 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。

7月29日周三
  1. Berkeley AI Research70

    K-Search 将 CUDA 内核优化经验迁移到 Apple Silicon,注意力内核达 0.97x 原生性能

    Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。

    推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。

7月28日周二
7月27日周一
  1. Hugging Face Blog62

    NVIDIA 发布 Cosmos-H-Dreams 实时手术机器人生成式模拟器

    NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式模拟器。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上实现约 160 帧每秒的交互式运行,支持键盘、Meta Quest 控制器或学习策略闭环控制。

    推荐理由:原文给出了从离线世界模型到实时交互模拟器的能力跃迁和具体帧率数字,读者可据此判断它在手术机器人训练与评估中的适用场景。

  2. Hugging Face Blog89

    Hugging Face 披露 2026 年 7 月智能体入侵事件技术细节

    Hugging Face 发布 2026 年 7 月入侵事件的技术时间线,还原了由 OpenAI 模型驱动的自主智能体如何利用两个注入向量进入其数据集处理管道,并在约 4.5 天内横向移动至内部集群和供应链。

    推荐理由:原文完整复盘了攻击链、取证方法和加固措施,读者可据此理解智能体攻击的运作方式与防御要点。

7月26日周日
  1. Berkeley AI Research62

    ABBEL:用自然语言信念状态监督提升长程交互的摘要学习效率

    Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。

    推荐理由:原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。

7月23日周四
  1. Google Research62

    Google Research 发布 SymptomAI 研究:对话式 AI 智能体用于日常症状评估

    Google Research 发布 SymptomAI 研究,在 n=13,917 的全国随机对照中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体交互,并由临床专家盲评其鉴别诊断(DDx)表现。

    推荐理由:原文给出了大规模随机对照结果和可穿戴生物信号佐证,读者可据此评估对话式AI症状评估的真实水平。

  2. Google Research60

    Google Research 在 Nature 发表论文:强化学习让量子计算机从错误中学习

    Google Research 在 Nature 发表论文,提出用强化学习框架让自主智能体从量子错误检测中持续学习,动态调控数千个控制参数,在计算过程中稳定量子系统对抗漂移。在 Willow 处理器上,该方法将逻辑稳定性提升 3.5 倍,并在专家校准后进一步将逻辑错误率降低 20%。

    推荐理由:原文展示了强化学习如何让量子计算机在运行中持续校准,读者可借此理解机器学习在量子纠错中的新角色。

7月22日周三
7月21日周二
  1. Hugging Face Blog70

    Hugging Face 发布 Grabette 开源手持采集系统

    Hugging Face 发布 Grabette,一套开源、低成本的机器人操作数据采集系统,手持夹爪配合双摄像头即可记录演示并自动生成 LeRobot 格式数据集,无需机器人或实验室。整套硬件与处理管线全部开源,配套 Gripette 机械夹爪用于训练后执行,目标是推动社区共建大规模操作数据集。

    推荐理由:原文给出了低成本手持采集方案的全套开源硬件与处理流程,读者可据此判断它能否降低机器人数据采集门槛。

7月17日周五
7月16日周四
  1. Hugging Face Blog54

    DharmaOCR 对比 Mistral OCR4 与 Unlimited-OCR:专精模型在巴西葡萄牙语上仍占优

    Dharma AI 发文称,其三个月前开源的巴西葡萄牙语 OCR 模型 DharmaOCR 在专为该语言设计的基准上得分 0.925,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。文章认为优势来自两阶段训练:监督微调集中资源于目标语言,DPO 阶段抑制生成退化,并指出通用模型在处理 ENEM 作文等专有名词时更易出错。

  2. Google DeepMind50

    Google DeepMind 与 Isomorphic Labs 公布生物韧性联合方案

    Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,通过防止模型滥用并帮助政府、科学家利用 AI 应对传染病爆发。过去 12 个月已推进超 15 项合作,覆盖预防、检测、响应三领域,包括将 SynthID 水印技术适配生物学、用 AlphaEvolve 优化病原体监测,并向可信研究人员开放最新 AI 系统以加速疫苗设计。

  3. Hugging Face Blog82

    Hugging Face 披露 AI 智能体驱动的安全入侵事件

    Hugging Face 披露本周检测到一次由自主 AI 智能体系统端到端驱动的生产基础设施入侵,攻击者利用数据集处理中的两个代码执行路径获得初始访问,并在周末横向移动至多个内部集群。

    推荐理由:原文披露了首个由自主AI智能体全程驱动的入侵事件,并给出防御方用开源模型完成取证的具体做法,可据此评估智能体攻击的现实威胁。

  4. Google Research38

    扩散模型的创造力从何而来:Google 研究揭示“分数平滑”机制

    Google Research 在 ICLR 2026 发表论文,从数学上解释扩散模型的“创造力”并非偶然,而是源于神经网络训练中正则化导致的“分数平滑”效应。该效应使模型在去噪过程中生成训练数据点之间的插值样本,而非简单记忆。研究还发现,即使不显式使用权重衰减,梯度算法带来的隐式正则化也能产生同样效果。

  5. Hugging Face Blog62

    IBM Research:模型路由看似简单,实则是系统优化问题

    IBM Research 在博客中分享构建智能体路由器的经验,指出模型选择实际是系统优化问题。实测中 GPT-4.1 在 AppWorld 测试上成本是 Claude Sonnet 4.6 的近两倍,原因是缓存命中率差异;任务难度在路由时往往不可见,且需同时权衡成本、延迟、合规等多重因素。他们的优化算法在保持轻量(每任务约 6 ms、2 kB 内存)的同时,提供了成本、延迟、精度之间的可调操作点。

    推荐理由:作者用实测数据拆解了路由优化的三个隐藏维度,读者可据此重新审视自家智能体系统的成本与延迟优化思路。

7月15日周三
  1. Hugging Face Blog82

    Thinking Machines 发布开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,约 1T 参数、支持 1M 上下文,原生接受图像、文本和音频输入,具备智能体能力,并提供 BF16 和 NVFP4 变体。

    推荐理由:原文给出了 Inkling 的架构细节、部署配置和基准表现,读者可以据此判断它作为开源多模态模型的定位与可用性。

  2. Hugging Face Blog62

    Hugging Face 推出 Real World VoiceEQ 语音 AI 评测基准

    Hugging Face 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多个主流开源与专有语音模型、15 项以上评测维度和 60 多项指标,基于超过 100 万条人工评分构建。评测发现语音模型在听与说能力上分化明显,传统基准可能高估真实表现,且语音语言模型尚不能完全替代人工评测。

    推荐理由:原文给出了新基准的规模、维度与关键发现,读者可据此判断现有语音模型评测的盲区。

7月13日周一
7月10日周五
7月9日周四
  1. Mistral AI50

    Mistral Studio 为 Prompts 和 Skills 提供系统化记录

    Mistral Studio 今日起为 Prompts 和 Skills 提供系统化记录,实现版本管理、明确归属与全程可追溯。每个版本不可变,支持对比回滚,变更记录含操作者与时间,并通过标签分类和审计日志确保合规。资产可直接作为 MCP 服务器运行,结合可观测性追踪生产输出与版本关联,数据始终留在企业边界内。

  2. Google Research70

    Google Research 发布 SensorFM,用一万亿分钟可穿戴数据训练通用健康传感器基础模型

    Google Research 发布 SensorFM,一个基于超过一万亿分钟、来自五百万名同意参与者的多模态可穿戴数据预训练的大型传感器基础模型。SensorFM 通过自监督重建学习,可跨心血管、代谢、睡眠和心理健康等任务迁移,在 35 项健康任务中 34 项优于特征工程监督基线。模型还结合了智能体课堂自动构建预测头,并能支撑个人健康智能体的端到端应用。

    推荐理由:原文给出了一万亿分钟级可穿戴数据训练的通用传感器基础模型,读者可据此判断它能否替代单任务健康模型。

7月8日周三
  1. Mistral AI62

    Mistral AI 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布 Robostral Navigate,一个 8B 参数的具身导航模型,仅用单个 RGB 摄像头即可让机器人自主导航,在 R2R-CE 验证 unseen 上取得 76.6% 成功率,超过使用深度或多摄像头的最佳系统 4.5 个点。模型完全在模拟环境中训练,通过指向式导航和在线强化学习(CISPO)持续改进,可运行于轮式、腿式和飞行机器人。

    推荐理由:原文给出了单摄像头导航模型在 R2R-CE 上的成绩和训练方法,读者可据此判断它相对多传感器方案的效率优势。

  2. Hugging Face Blog75

    vLLM transformers 建模后端提速至原生速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。

    推荐理由:原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。

  3. Google Research62

    Google Research 在 Nature Cities 发表城市拥堵缓解实验

    Google Research 在 Nature Cities 发表研究,通过在 10 个美国城市开展为期六个月的切换实验,仅协调不到 2% 的行程改走相似耗时路线,就使目标路段车速中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%,并估算每城每年可减少数千吨 CO2e 排放。该研究为从个体路线优化走向全网络协同路由提供了实验框架。

    推荐理由:原文给出了首个大规模真实城市路由干预实验的方法与量化结果,读者可据此评估导航平台协调交通的实际收益。

7月7日周二
  1. Berkeley AI Research62

    智能体时代的数据系统:为智能体、由智能体、由智能体合成

    UC Berkeley 团队发文指出,推理成本正以每年约 50 倍的中位数速度下降,智能体即将成为数据系统的主要工作负载。文章提出数据系统面临的三大挑战:为智能体设计(支持智能体式推测查询)、由智能体管理(多智能体共享状态与协调)、由智能体合成(按工作负载自动生成定制数据系统),并展望两者边界将逐渐模糊。

    推荐理由:文章从推理成本骤降出发,梳理了数据系统为智能体服务、由智能体管理、由智能体合成的三条研究路线,适合想把握数据系统与智能体融合方向的人。

  2. Hugging Face Blog78

    LeRobot v0.6.0 发布:引入世界模型、新 VLA 与统一评测基准

    LeRobot v0.6.0 正式发布,旨在闭环机器人学习流程。新版本引入三种世界模型策略(VLA-JEPA、LingBot-VA、FastWAM),新增多个 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),并推出统一的奖励模型 API(Robometer、TOPReward)。

    推荐理由:官方发布 LeRobot v0.6.0,涵盖世界模型、新 VLA、奖励模型、评测基准与部署 CLI,可帮助读者了解开源机器人学习框架的最新能力。

  3. Hugging Face Blog78

    SkyPilot 与 Hugging Face 联合推出零出口流量存储,跨云训练直接挂载 Hub 数据

    SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。

    推荐理由:原文给出了 hf:// 挂载、零出口流量和 Xet 去重的具体机制与实测数字,读者可据此判断跨云训练的数据成本能省多少。

7月6日周一
  1. Hugging Face Blog62

    Photoroom 详解 PRX 图像模型的数据策略:从数据源到去重过滤的完整管线

    Photoroom 发布 PRX 系列第四篇博客,详解其图像生成模型 PRX 的预训练数据策略。数据管线混合公开与内部数据集,用 VLM 重写长标题,以 Lance 构建、MDS 流式训练,并采用 JPEG 质量 92 存储、感知哈希去重和基于标题的轻量过滤。作者对比了多个标题生成模型,最终选用 Qwen3-VL-8B,并分享了碎片化、跳过列表等工程经验。

    推荐理由:Photoroom 公开了 PRX 图像模型预训练数据管线的完整设计,从数据源、重写标题到去重过滤,读者可据此复现或改进自己的数据流程。

  2. Hugging Face Blog62

    Hugging Face 重构 Kernels 项目:新增内核仓库类型、代码签名与智能体开发支持

    Hugging Face 发布 Kernels 项目重大更新,在 Hub 上引入新的 kernel 仓库类型,并默认只加载受信任发布者的内核,同时加入基于 Sigstore cosign 的代码签名机制。

    推荐理由:原文梳理了内核仓库类型、签名验证和 CLI 重构等关键变化,读者可据此判断新内核工作流的安全边界与适配范围。

7月3日周五
7月2日周四
  1. Mistral AI82

    Mistral 发布 Leanstral 1.5,6B 激活参数开源模型在形式化验证上刷新多项基准

    Mistral 发布 Leanstral 1.5,一款 Apache-2.0 许可、总参数 119B 但仅 6B 激活的开源模型,在 miniF2F 上达到 100%,解决 PutnamBench 587/672 题,并在 FATE-H(87%)和 FATE-X(34%)上取得新 SOTA。

    推荐理由:原文给出了基准成绩、成本对比和真实代码库找 bug 的案例,读者可据此判断它在形式化验证上的实用程度。

7月1日周三
  1. Hugging Face Blog60

    Hugging Face 与 Cerebras 联手推出实时语音 AI 演示

    Hugging Face 与 Cerebras 合作推出实时语音 AI 演示,构建了全开源的级联式语音到语音流水线:语音输入经 Nvidia Parakeet 识别,由 Cerebras 上的 Gemma 4 31B 处理,再经阿里 Qwen3TTS 合成语音输出。该流水线已驱动超过 9,000 台 Reachy Mini 机器人,旨在通过低延迟和稳定推理改善对话的自然感。

    推荐理由:原文展示了开源语音流水线与 Cerebras 推理速度结合后的实时对话体验,读者可据此评估端到端语音方案的延迟表现。

  2. Hugging Face Blog62

    IBM 发布 ScarfBench,用于评测 AI 智能体的企业 Java 框架迁移能力

    IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。

    推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。

  3. Google Research62

    Google Research 发布 50+ 城市建筑级屋顶反照率数据集及 Heat Resilience Earth Engine App

    Google Research 发布覆盖 50+ 城市、9 个国家的建筑级屋顶反照率数据集,并上线 Heat Resilience Earth Engine App 供公众使用。

    推荐理由:原文给出了数据覆盖范围、精度验证和开放入口,读者可以据此判断这类建筑级反照率数据对城市热缓解规划的实际可用性。