Google DeepMind 发布 Lyria 3.5 音乐生成模型
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。
Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。
推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:Gemini Robotics 2 是最先进的视觉-语言-动作模型(VLA)。
推荐理由:原文给出了三款模型的分工和开放入口,读者可据此判断具身智能模型的能力边界与接入方式。
NVIDIA 发布 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式模拟器。它将 Cosmos-H-Surgical-Simulator 蒸馏为因果少步学生模型,并通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上实现约 160 帧每秒的交互式运行,支持键盘、Meta Quest 控制器或学习策略闭环控制。
推荐理由:原文给出了从离线世界模型到实时交互模拟器的能力跃迁和具体帧率数字,读者可据此判断它在手术机器人训练与评估中的适用场景。
Hugging Face 发布 2026 年 7 月入侵事件的技术时间线,还原了由 OpenAI 模型驱动的自主智能体如何利用两个注入向量进入其数据集处理管道,并在约 4.5 天内横向移动至内部集群和供应链。
推荐理由:原文完整复盘了攻击链、取证方法和加固措施,读者可据此理解智能体攻击的运作方式与防御要点。
Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。
推荐理由:原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。
Hugging Face 宣布 Diffusers 现已原生支持 Nunchaku 4-bit 扩散推理,加载预量化 checkpoint 只需调用 from_pretrained(),无需本地 CUDA 编译。
推荐理由:官方博客说明 Nunchaku 4-bit 扩散推理已原生接入 Diffusers,读者可据此判断量化推理的落地方式与收益。
Google Research 发布 SymptomAI 研究,在 n=13,917 的全国随机对照中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体交互,并由临床专家盲评其鉴别诊断(DDx)表现。
推荐理由:原文给出了大规模随机对照结果和可穿戴生物信号佐证,读者可据此评估对话式AI症状评估的真实水平。
Google Research 在 Nature 发表论文,提出用强化学习框架让自主智能体从量子错误检测中持续学习,动态调控数千个控制参数,在计算过程中稳定量子系统对抗漂移。在 Willow 处理器上,该方法将逻辑稳定性提升 3.5 倍,并在专家校准后进一步将逻辑错误率降低 20%。
推荐理由:原文展示了强化学习如何让量子计算机在运行中持续校准,读者可借此理解机器学习在量子纠错中的新角色。
Google 在 DOE Genesis Mission Summit 2026 上宣布,为支持美国 Genesis 科研计划,承诺提供 4000 万美元的 AI tokens 和云积分。
推荐理由:原文给出了资金规模、工具清单和实验室实测数据,读者可据此判断这笔投入对科研流程的实际影响。
Google DeepMind 发布三款新 Gemini 模型。Gemini 3.6 Flash 相比 3.5 Flash 减少 17% 输出 token 用量。
推荐理由:官方给出三款新模型的定价、token 效率与关键基准提升,读者可据此评估其在智能体工作流中的成本与性能取舍。
Hugging Face 发布 Grabette,一套开源、低成本的机器人操作数据采集系统,手持夹爪配合双摄像头即可记录演示并自动生成 LeRobot 格式数据集,无需机器人或实验室。整套硬件与处理管线全部开源,配套 Gripette 机械夹爪用于训练后执行,目标是推动社区共建大规模操作数据集。
推荐理由:原文给出了低成本手持采集方案的全套开源硬件与处理流程,读者可据此判断它能否降低机器人数据采集门槛。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调而成的轻量网络安全模型,用于快速发现、验证和修复软件漏洞。
推荐理由:原文给出了轻量安全模型的定位、基准成绩和内部落地效果,读者可据此判断它在漏洞挖掘场景中的实际价值。
Dharma AI 发文称,其三个月前开源的巴西葡萄牙语 OCR 模型 DharmaOCR 在专为该语言设计的基准上得分 0.925,高于 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587。文章认为优势来自两阶段训练:监督微调集中资源于目标语言,DPO 阶段抑制生成退化,并指出通用模型在处理 ENEM 作文等专有名词时更易出错。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,通过防止模型滥用并帮助政府、科学家利用 AI 应对传染病爆发。过去 12 个月已推进超 15 项合作,覆盖预防、检测、响应三领域,包括将 SynthID 水印技术适配生物学、用 AlphaEvolve 优化病原体监测,并向可信研究人员开放最新 AI 系统以加速疫苗设计。
Hugging Face 披露本周检测到一次由自主 AI 智能体系统端到端驱动的生产基础设施入侵,攻击者利用数据集处理中的两个代码执行路径获得初始访问,并在周末横向移动至多个内部集群。
推荐理由:原文披露了首个由自主AI智能体全程驱动的入侵事件,并给出防御方用开源模型完成取证的具体做法,可据此评估智能体攻击的现实威胁。
Google Research 在 ICLR 2026 发表论文,从数学上解释扩散模型的“创造力”并非偶然,而是源于神经网络训练中正则化导致的“分数平滑”效应。该效应使模型在去噪过程中生成训练数据点之间的插值样本,而非简单记忆。研究还发现,即使不显式使用权重衰减,梯度算法带来的隐式正则化也能产生同样效果。
IBM Research 在博客中分享构建智能体路由器的经验,指出模型选择实际是系统优化问题。实测中 GPT-4.1 在 AppWorld 测试上成本是 Claude Sonnet 4.6 的近两倍,原因是缓存命中率差异;任务难度在路由时往往不可见,且需同时权衡成本、延迟、合规等多重因素。他们的优化算法在保持轻量(每任务约 6 ms、2 kB 内存)的同时,提供了成本、延迟、精度之间的可调操作点。
推荐理由:作者用实测数据拆解了路由优化的三个隐藏维度,读者可据此重新审视自家智能体系统的成本与延迟优化思路。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,约 1T 参数、支持 1M 上下文,原生接受图像、文本和音频输入,具备智能体能力,并提供 BF16 和 NVFP4 变体。
推荐理由:原文给出了 Inkling 的架构细节、部署配置和基准表现,读者可以据此判断它作为开源多模态模型的定位与可用性。
Hugging Face 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多个主流开源与专有语音模型、15 项以上评测维度和 60 多项指标,基于超过 100 万条人工评分构建。评测发现语音模型在听与说能力上分化明显,传统基准可能高估真实表现,且语音语言模型尚不能完全替代人工评测。
推荐理由:原文给出了新基准的规模、维度与关键发现,读者可据此判断现有语音模型评测的盲区。
Google DeepMind 今日启动 ATL Saathi 实时试点,这是一款基于 Gemini 的 Web 应用,为印度 Atal Tinkering Labs 的每位教育者提供 24/7 规划与培训助手,覆盖超 1.1 千万学生。
Hugging Face 发布 PyTorch 性能剖析系列第三篇,用 profiler 对比朴素注意力、原地掩码、SDPA 的 math、efficient、flash 和 cuDNN 后端。
推荐理由:用可复现脚本逐层对比注意力各实现的 profiler 足迹,能帮读者建立先猜测再验证的调优习惯。
Mistral Studio 今日起为 Prompts 和 Skills 提供系统化记录,实现版本管理、明确归属与全程可追溯。每个版本不可变,支持对比回滚,变更记录含操作者与时间,并通过标签分类和审计日志确保合规。资产可直接作为 MCP 服务器运行,结合可观测性追踪生产输出与版本关联,数据始终留在企业边界内。
Google Research 发布 SensorFM,一个基于超过一万亿分钟、来自五百万名同意参与者的多模态可穿戴数据预训练的大型传感器基础模型。SensorFM 通过自监督重建学习,可跨心血管、代谢、睡眠和心理健康等任务迁移,在 35 项健康任务中 34 项优于特征工程监督基线。模型还结合了智能体课堂自动构建预测头,并能支撑个人健康智能体的端到端应用。
推荐理由:原文给出了一万亿分钟级可穿戴数据训练的通用传感器基础模型,读者可据此判断它能否替代单任务健康模型。
Mistral AI 发布 Robostral Navigate,一个 8B 参数的具身导航模型,仅用单个 RGB 摄像头即可让机器人自主导航,在 R2R-CE 验证 unseen 上取得 76.6% 成功率,超过使用深度或多摄像头的最佳系统 4.5 个点。模型完全在模拟环境中训练,通过指向式导航和在线强化学习(CISPO)持续改进,可运行于轮式、腿式和飞行机器人。
推荐理由:原文给出了单摄像头导航模型在 R2R-CE 上的成绩和训练方法,读者可据此判断它相对多传感器方案的效率优势。
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。
推荐理由:原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页一键点击“Customize on SageMaker AI”或“Deploy on SageMaker AI”,直接进入 SageMaker Studio 对应工作流,模型预载且环境自动配置。
Google Research 在 Nature Cities 发表研究,通过在 10 个美国城市开展为期六个月的切换实验,仅协调不到 2% 的行程改走相似耗时路线,就使目标路段车速中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%,并估算每城每年可减少数千吨 CO2e 排放。该研究为从个体路线优化走向全网络协同路由提供了实验框架。
推荐理由:原文给出了首个大规模真实城市路由干预实验的方法与量化结果,读者可据此评估导航平台协调交通的实际收益。
微软在 Build 2026 上宣布 Foundry Managed Compute 支持 Hugging Face 模型,提供每周刷新的精选开源权重目录,可一键部署到托管 GPU 平台。
推荐理由:原文给出了模型目录、一键部署流程和运行时选型,读者可以据此评估在 Foundry 上托管开源模型的成本与运维方式。
UC Berkeley 团队发文指出,推理成本正以每年约 50 倍的中位数速度下降,智能体即将成为数据系统的主要工作负载。文章提出数据系统面临的三大挑战:为智能体设计(支持智能体式推测查询)、由智能体管理(多智能体共享状态与协调)、由智能体合成(按工作负载自动生成定制数据系统),并展望两者边界将逐渐模糊。
推荐理由:文章从推理成本骤降出发,梳理了数据系统为智能体服务、由智能体管理、由智能体合成的三条研究路线,适合想把握数据系统与智能体融合方向的人。
LeRobot v0.6.0 正式发布,旨在闭环机器人学习流程。新版本引入三种世界模型策略(VLA-JEPA、LingBot-VA、FastWAM),新增多个 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),并推出统一的奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布 LeRobot v0.6.0,涵盖世界模型、新 VLA、奖励模型、评测基准与部署 CLI,可帮助读者了解开源机器人学习框架的最新能力。
SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出了 hf:// 挂载、零出口流量和 Xet 去重的具体机制与实测数字,读者可据此判断跨云训练的数据成本能省多少。
Photoroom 发布 PRX 系列第四篇博客,详解其图像生成模型 PRX 的预训练数据策略。数据管线混合公开与内部数据集,用 VLM 重写长标题,以 Lance 构建、MDS 流式训练,并采用 JPEG 质量 92 存储、感知哈希去重和基于标题的轻量过滤。作者对比了多个标题生成模型,最终选用 Qwen3-VL-8B,并分享了碎片化、跳过列表等工程经验。
推荐理由:Photoroom 公开了 PRX 图像模型预训练数据管线的完整设计,从数据源、重写标题到去重过滤,读者可据此复现或改进自己的数据流程。
Hugging Face 发布 Kernels 项目重大更新,在 Hub 上引入新的 kernel 仓库类型,并默认只加载受信任发布者的内核,同时加入基于 Sigstore cosign 的代码签名机制。
推荐理由:原文梳理了内核仓库类型、签名验证和 CLI 重构等关键变化,读者可据此判断新内核工作流的安全边界与适配范围。
Google DeepMind 与电影工作室 A24 宣布建立首次研究合作,旨在帮助艺术家开发新工作流程与技术,确保未来工具由创作者塑造。合作将围绕多个项目展开,让 A24 电影人直接参与技术研发,同时 Google 已对 A24 进行投资。
Mistral 发布 Leanstral 1.5,一款 Apache-2.0 许可、总参数 119B 但仅 6B 激活的开源模型,在 miniF2F 上达到 100%,解决 PutnamBench 587/672 题,并在 FATE-H(87%)和 FATE-X(34%)上取得新 SOTA。
推荐理由:原文给出了基准成绩、成本对比和真实代码库找 bug 的案例,读者可据此判断它在形式化验证上的实用程度。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生去向,涵盖机器人、大语言模型、计算机视觉、AI 安全等领域。毕业生将前往 Physical Intelligence、OpenAI、Amazon、Mistral AI 等机构任职,或进入 UCLA、芝加哥大学等高校担任教职,也有毕业生正在创业并招募人才。
Hugging Face 与 Cerebras 合作推出实时语音 AI 演示,构建了全开源的级联式语音到语音流水线:语音输入经 Nvidia Parakeet 识别,由 Cerebras 上的 Gemma 4 31B 处理,再经阿里 Qwen3TTS 合成语音输出。该流水线已驱动超过 9,000 台 Reachy Mini 机器人,旨在通过低延迟和稳定推理改善对话的自然感。
推荐理由:原文展示了开源语音流水线与 Cerebras 推理速度结合后的实时对话体验,读者可据此评估端到端语音方案的延迟表现。
IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。
推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。
Google Research 发布覆盖 50+ 城市、9 个国家的建筑级屋顶反照率数据集,并上线 Heat Resilience Earth Engine App 供公众使用。
推荐理由:原文给出了数据覆盖范围、精度验证和开放入口,读者可以据此判断这类建筑级反照率数据对城市热缓解规划的实际可用性。