跳到正文

#推理

今日 0 条
9月21日周一
  1. Hugging Face Blog62

    Multiverse 提出将 LLM 块剪枝转化为伊辛优化问题,深度压缩下 MMLU 提升近 23 个百分点

    Multiverse Computing 发表论文,将大语言模型的块删除(深度剪枝)重构为约束二元优化问题,映射到伊辛玻璃自旋系统,用能量作为下游性能的廉价代理,从而无需逐一基准测试即可筛选大量候选配置。

    推荐理由:把剪枝块选择映射为伊辛玻璃能量最小化,用物理求解器处理组合问题,在深度压缩下显著领先现有方法。

9月16日周三
  1. Google Research38

    绕过推理瓶颈:Google 用 Retrieve-for-Train 加速复杂 AI 搜索

    Google 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线强化学习将属性对齐的查询扇出编译为监督信号,并蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归推理,无需测试时思维 token。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,解决零样本 LLM 的释义坍缩与自回归延迟瓶颈。

9月8日周二
9月2日周三
  1. Hugging Face Blog42

    BenchMIRT:LLM 基准测试究竟在衡量什么?

    Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。

8月25日周二
  1. Hugging Face Blog75

    IBM 发布 Granite 4.2 推理模型家族:3B、8B、30B 三档开源

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个尺寸,均基于 Granite-4.1 基座模型后训练而来,采用多阶段强化学习流水线,其中 8B 和 30B 额外经过智能体强化学习,可在真实沙箱环境中调用工具、编辑代码、操作终端和搜索网页。所有模型均支持思考与非思考模式切换、低努力思考模式及原生工具调用,以 Apache 2.0 协议开源。

    推荐理由:IBM 官方详解 Granite 4.2 推理模型家族的构建过程,读者可借此了解其多阶段强化学习与智能体训练的具体做法。

  2. Hugging Face Blog62

    Quantization-Aware Healing 论文:4-bit 压缩模型在 7/9 基准上超越其全精度原版

    Multiverse Computing 发布论文《Quantization-Aware Healing》,提出从压缩前原模型直接蒸馏的修复方法,应用于 GPT-OSS 120B 压缩至 60B 并量化到 MXFP4 后,在 7/9 基准上超越其 bfloat16 版本,其中长上下文推理 +7.4、数学 +5.6。

    推荐理由:论文提出从压缩前原模型蒸馏的修复方法,让 4-bit 模型在多数基准上反超自身 bfloat16 版本,并对比了与 QAT 的稳定性差异。

8月19日周三
  1. Hugging Face Blog62

    IBM 研究:智能体记忆剂量需按模型能力校准,而非简单累积

    IBM 研究团队发布 ALTK-Evolve 相关研究,探讨智能体需要多少记忆。在八款模型上的 AppWorld 评测显示,强模型适合完整指南集,弱模型适合精简核心加按任务检索,饱和模型无增益。gpt-oss-120b 用精选检索在仅增加 5% token 时提升 16.1 个百分点任务完成率,提示缓存可降低生产环境成本。

    推荐理由:原文用八模型实测说明智能体记忆并非越多越好,剂量需按模型能力校准,并给出成本数据。

8月13日周四
8月12日周三
  1. Google Research62

    Google Research 提出知识画像框架:召回是参数化事实性的瓶颈

    Google Research 提出知识画像框架,将事实状态分为编码失败、召回失败等五类,并发布 WikiProfile 基准,含 2,150 条维基百科事实。

    推荐理由:论文用知识画像框架区分编码与召回失败,指出前沿模型的事实错误主要来自知识难以访问而非缺失,并验证了思考机制能恢复部分已编码事实。

8月11日周二
7月31日周五
  1. Microsoft Research62

    微软研究院发布 EvoLib 框架,将经验转化为可进化的知识库

    微软研究院发布 EvoLib 框架,让大语言模型在推理过程中从自身经验中学习,无需真值标签或外部反馈,将过往尝试转化为可复用的技能和反思性洞察。EvoLib 通过整合与动态加权机制持续精炼知识,在数学推理、代码编写和长程决策任务上优于顶级检索式记忆方法,且对任务顺序具有鲁棒性。代码和实验结果已在 GitHub 上公开。

    推荐理由:原文给出了将经验转化为可复用知识的具体机制和跨任务评测结果,读者可据此判断这类记忆进化方法相对传统检索记忆的实际收益。

7月29日周三
  1. Berkeley AI Research70

    K-Search 将 CUDA 内核优化经验迁移到 Apple Silicon,注意力内核达 0.97x 原生性能

    Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。

    推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。

7月26日周日
  1. Berkeley AI Research62

    ABBEL:用自然语言信念状态监督提升长程交互的摘要学习效率

    Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。

    推荐理由:原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。

7月23日周四
  1. Google Research60

    Google Research 在 Nature 发表论文:强化学习让量子计算机从错误中学习

    Google Research 在 Nature 发表论文,提出用强化学习框架让自主智能体从量子错误检测中持续学习,动态调控数千个控制参数,在计算过程中稳定量子系统对抗漂移。在 Willow 处理器上,该方法将逻辑稳定性提升 3.5 倍,并在专家校准后进一步将逻辑错误率降低 20%。

    推荐理由:原文展示了强化学习如何让量子计算机在运行中持续校准,读者可借此理解机器学习在量子纠错中的新角色。

7月16日周四
  1. Google Research38

    扩散模型的创造力从何而来:Google 研究揭示“分数平滑”机制

    Google Research 在 ICLR 2026 发表论文,从数学上解释扩散模型的“创造力”并非偶然,而是源于神经网络训练中正则化导致的“分数平滑”效应。该效应使模型在去噪过程中生成训练数据点之间的插值样本,而非简单记忆。研究还发现,即使不显式使用权重衰减,梯度算法带来的隐式正则化也能产生同样效果。

6月30日周二
6月27日周六
  1. Google Research60

    Google Research 用冻结多 token 预测加速 Pixel 上的 Gemini Nano 模型

    Google Research 宣布一种新架构,将多 token 预测(MTP)头附加到冻结的 Gemini Nano v3 模型上,以加速 Pixel 9 和 10 系列上的端侧推理。相比独立草稿模型,MTP 在 Pixel 9 上带来 50% 或以上的速度提升,并节省约 130MB 内存,同时保持输出与主模型逐位一致。该方案已用于 AI 通知摘要和校对等功能,减少能耗并提升电池续航。

    推荐理由:原文给出冻结骨干加 MTP 头的端侧加速方案,读者可据此判断其相对独立草稿模型的效率优势。

6月25日周四
  1. Google Research60

    Google Research 揭示推理如何解锁 LLM 参数化知识

    Google Research 在 COLM 2026 发表的论文中,通过受控实验证明允许模型生成推理轨迹能解锁原本无法获取的正确事实答案。研究识别出计算缓冲和事实启动两种互补机制,并发现推理轨迹中若含单个幻觉中间事实会显著降低最终答案正确率。基于此,研究提出在测试时优先保留无幻觉事实的推理轨迹可提升准确率,并建议训练时用过程奖励鼓励事实支持的中间步骤。

    推荐理由:原文用受控实验拆解了推理为何能解锁参数化知识,并给出可落地的训练优化方向。

5月16日周六
  1. Google DeepMind62

    Co-Scientist 助力发现肝纤维化重定位药物

    斯坦福大学遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选肝纤维化候选药物,在活体人类肝细胞测试中,Co-Scientist 选出的三种候选药有两种能阻断纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的损伤反应,而 Peltz 自行挑选的两种药物均未见效果。

    推荐理由:原文呈现了AI智能体在药物重定位中的具体实验结果,读者可据此评估其在该领域的实际价值。

5月8日周五
  1. Berkeley AI Research62

    自适应并行推理:高效推理扩展的下一个范式

    Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。

    推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。

4月22日周三
  1. Google Research60

    Google Research 提出 ReasoningBank 智能体记忆框架,从成功与失败经验中提炼推理模式

    Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中提炼高层结构化推理记忆的智能体框架,用于测试时自我进化。

    推荐理由:原文给出了 ReasoningBank 在 WebArena 和 SWE-Bench-Verified 上的成功率与效率提升数据,读者可据此判断该记忆框架的实际收益。

4月20日周一
3月25日周三
3月17日周二
3月13日周五