跳到正文

#论文/研究

今日 2 条
今天9月29日周二
  1. The Decoder62

    Atria 团队发布智能体参与模型开发的研究:人类仍掌握最终决策

    Atria 团队发布研究,记录开发 7440 亿参数混合专家模型 Atria Dawn Preview 过程中人类与智能体的分工。AI 参与了 96.5% 的任务,约三分之一的任务离开 AI 无法完成,但人类在 85.5% 的方法与参数决策和 93.4% 的目标决策中拥有最终决定权。研究指出智能体从研究对象演变为项目伙伴,递归自我改进仍是开放问题。

  2. The Decoder62

    20多位顶尖AI研究者警告自动化AI研究可能引发智能爆炸

    20多位AI研究者(包括Geoffrey Hinton、Yoshua Bengio和OpenAI研究负责人Jakub Pachocki)在新论文中警告,自我改进的AI可能很快引发智能爆炸。论文指出,AI系统已在编写大部分代码,可能数年内自动化整个AI研发流程,使原本需数年的进展在数月内完成,并呼吁政策制定者加强对AI研究自动化的监管。

9月25日周五
9月24日周四
  1. Microsoft Research68

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。

    推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。

9月21日周一
  1. Microsoft Research62

    微软发布逆合成预测模型 RetroChimera,论文发表于 Nature

    微软研究团队在 Nature 发表逆合成预测模型 RetroChimera,结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习排序整合两者预测。盲测中博士级化学家更偏好其单步反应预测,多步合成路线在十个挑战性目标中成功九个。模型已开源(MIT 许可),并可通过 Microsoft Foundry 访问。

    推荐理由:原文给出了模型架构、开源信息和专家盲测结果,读者可据此判断它在逆合成预测上的实际表现。

  2. Hugging Face Blog62

    Multiverse 提出将 LLM 块剪枝转化为伊辛优化问题,深度压缩下 MMLU 提升近 23 个百分点

    Multiverse Computing 发表论文,将大语言模型的块删除(深度剪枝)重构为约束二元优化问题,映射到伊辛玻璃自旋系统,用能量作为下游性能的廉价代理,从而无需逐一基准测试即可筛选大量候选配置。

    推荐理由:把剪枝块选择映射为伊辛玻璃能量最小化,用物理求解器处理组合问题,在深度压缩下显著领先现有方法。

9月19日周六
9月18日周五
9月16日周三
  1. Google Research38

    绕过推理瓶颈:Google 用 Retrieve-for-Train 加速复杂 AI 搜索

    Google 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线强化学习将属性对齐的查询扇出编译为监督信号,并蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归推理,无需测试时思维 token。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,解决零样本 LLM 的释义坍缩与自回归延迟瓶颈。

9月11日周五
9月4日周五
  1. Google Research62

    Google 与 HHMI Janelia 发布完整雄性果蝇脑图谱

    Google Research 与 HHMI Janelia 等合作方在 Cell 发表论文,发布完整雄性果蝇脑与中枢神经系统连接组图谱,含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最大的脑图谱。该图谱经人工校验,可通过开源工具 Neuroglancer 查看和下载,并与雌性果蝇图谱互补,用于研究两性差异及个体间变异性。

    推荐理由:原文给出了迄今最大的脑图谱及其开放下载入口,读者可据此了解连接组学方法的最新进展。

9月2日周三
  1. Hugging Face Blog42

    BenchMIRT:LLM 基准测试究竟在衡量什么?

    Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。

  2. Google Research62

    Google 与 NASA JPL 发布 MAPL-EMIT:用深度学习从太空绘制全球甲烷排放

    Google Research 与 NASA JPL 合作发表 PNAS 论文,提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 EMIT 高光谱数据,可同时完成甲烷羽流增强量化、羽流分割和源定位。

    推荐理由:原文给出了模型架构、训练方法和实测召回率,读者可据此评估这套深度学习方案在甲烷点源监测上的实际能力。

8月28日周五
  1. Google Research62

    Google Earth AI 推出行星预测引擎 PPE,自主完成地理空间建模全流程

    Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。

    推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。

8月27日周四
  1. Google Research45

    GlucoFM:面向连续血糖监测的双流基础模型

    Google Research 推出 GlucoFM,一种面向连续血糖监测(CGM)的自监督基础模型,采用双流设计分离缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,GlucoFM 的平均 PR-AUC 比最优 GluFormer 变体高 5.8 个百分点,并在所有糖尿病风险和 β 细胞功能障碍评估中领先。

8月26日周三
8月22日周六
8月21日周五
  1. Google Research42

    移动性如何让语言模型更深入地理解地点

    Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将聚合的匿名移动模式(如到达时间、停留时长)与文本描述结合,为地点构建动态嵌入。该框架在公开基准上使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估计提升 24.7%。ME-POIs 通过空间多尺度传播解决数据稀疏问题,并将移动性从预测任务转为定义地点本身的输入特征。

8月17日周一
  1. Google Research62

    Google Research 发布 PhotoScan:用智能手机照片估算体脂率与胰岛素抵抗风险

    Google Research 推出 PhotoScan,一个基于深度学习的研究框架,可从标准 2D 智能手机照片估算三维身体成分指标,包括体脂率(BF%)、A/G 比值和 V/S 比值。

    推荐理由:原文给出了PhotoScan在体脂率、A/G和V/S比值上的误差数据,以及相比智能手表BIA和DXA的预测能力对比,读者可据此判断智能手机影像估算代谢风险的可行性。

8月13日周四
8月12日周三
  1. Google Research62

    Google Research 提出知识画像框架:召回是参数化事实性的瓶颈

    Google Research 提出知识画像框架,将事实状态分为编码失败、召回失败等五类,并发布 WikiProfile 基准,含 2,150 条维基百科事实。

    推荐理由:论文用知识画像框架区分编码与召回失败,指出前沿模型的事实错误主要来自知识难以访问而非缺失,并验证了思考机制能恢复部分已编码事实。

  2. Microsoft Research62

    微软研究院发布 CARE-X 放射学视觉语言模型

    微软研究院发布 CARE-X,一个面向胸部 X 光临床解读的统一视觉语言模型,结合生成式报告与结构化预测,并采用 DAPO 强化学习优化临床正确性。在 Chest ImaGenome 异常分类上,CARE-X 辅助头在阈值 0.5 时达到 0.943 灵敏度,在 ReXVQA 基准上以 94% 准确率排名第一。

    推荐理由:原文展示了辅助监督与奖励对齐如何提升放射学视觉语言模型的临床实用性,并给出工具增强测量带来的显著性能提升。

7月31日周五
  1. Microsoft Research78

    微软 Echoverse:为计算机使用智能体构建深度演化训练环境

    微软研究院发布 Echoverse,一套为计算机使用智能体构建的深度演化训练环境,包含十个深度领域世界和两个能力世界。用全部十二个世界训练后,9B 模型得分从 36.5% 提升到 67.1%,接近 GPT-5.4。实验表明浅层环境会拖累模型,深度环境才能迁移;强化学习相对模仿学习能进一步提升留出集表现。微软开源了其中四个世界及其代码、数据和基于数据库的评分器。

    推荐理由:原文给出了深度合成环境对计算机使用智能体的训练收益,以及浅层环境反而拖累能力的对比证据,可据此判断训练数据质量与规模哪个更关键。

  2. Microsoft Research62

    微软研究院发布 EvoLib 框架,将经验转化为可进化的知识库

    微软研究院发布 EvoLib 框架,让大语言模型在推理过程中从自身经验中学习,无需真值标签或外部反馈,将过往尝试转化为可复用的技能和反思性洞察。EvoLib 通过整合与动态加权机制持续精炼知识,在数学推理、代码编写和长程决策任务上优于顶级检索式记忆方法,且对任务顺序具有鲁棒性。代码和实验结果已在 GitHub 上公开。

    推荐理由:原文给出了将经验转化为可复用知识的具体机制和跨任务评测结果,读者可据此判断这类记忆进化方法相对传统检索记忆的实际收益。

7月29日周三
  1. Berkeley AI Research70

    K-Search 将 CUDA 内核优化经验迁移到 Apple Silicon,注意力内核达 0.97x 原生性能

    Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。

    推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。

7月26日周日
  1. Berkeley AI Research62

    ABBEL:用自然语言信念状态监督提升长程交互的摘要学习效率

    Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。

    推荐理由:原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。

7月16日周四
  1. Google Research38

    扩散模型的创造力从何而来:Google 研究揭示“分数平滑”机制

    Google Research 在 ICLR 2026 发表论文,从数学上解释扩散模型的“创造力”并非偶然,而是源于神经网络训练中正则化导致的“分数平滑”效应。该效应使模型在去噪过程中生成训练数据点之间的插值样本,而非简单记忆。研究还发现,即使不显式使用权重衰减,梯度算法带来的隐式正则化也能产生同样效果。

6月25日周四
  1. Google Research47

    线性弹性缓存如何优化云成本:Google 将页面驱逐建模为滑雪租赁问题

    Google 在 CIDR 论文中提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,用轻量级机器学习动态调整缓存大小,以最小化缓存总拥有成本。集成到 Spanner 生产环境后,内存使用减少 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,且 I/O 成本影响仅 0.5%。该方法将驱逐策略与“租赁时长”分离,通过浅层决策树预测 TTL,并已在公开缓存轨迹上验证。

6月11日周四
  1. Google Research40

    Google Research 提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests

    Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于更灵敏、灵活、准确地审计机器学习模型的“遗忘”效果。该框架通过相对距离测试和自适应超参数选择,理论上可控制任意样本量下的假阳性,并随样本增加将假阴性风险收敛至零。实验涵盖合成基准与高能物理数据集 Expo1D 异常检测任务。

5月8日周五
  1. Berkeley AI Research62

    自适应并行推理:高效推理扩展的下一个范式

    Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。

    推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。

4月20日周一
3月13日周五
1月10日周六
  1. Berkeley AI Research40

    信息驱动式成像系统设计:直接评估与优化成像信息含量

    伯克利AI研究团队提出一种直接基于信息含量评估与优化成像系统的框架,无需训练重建或分类网络。该方法利用成像系统已知的噪声物理特性,仅从含噪测量中估计互信息,并在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证了其预测性能。优化该信息指标可达到与端到端方法相当的设计效果,同时减少内存与计算需求,且无需任务特定的解码器设计。