Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
GPT-6 Astra 完成 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。其对用户意图更强的理解能力,让 Basis 在实际应用中更有信心。
AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。
AWS 展示了如何在 SageMaker HyperPod 上运行开源 RL 框架 SkyRL,以 GRPO 算法训练 Qwen3-VL-8B 视觉语言模型导航视觉迷宫。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。相比 Opus 5,它用更少 token 完成任务,平均单任务成本更低,并首次配备生物、网络安全和 AI 开发领域的安全分类器。模型支持自适应思考,可通过 effort 控制推理量,适用于智能体编码和长文档知识工作。
推荐理由:原文给出了新模型的效率、定价与安全分类器变化,读者可据此评估其在长任务和智能体编码场景的适用性。
Multiverse Computing 发表论文,将大语言模型的块删除(深度剪枝)重构为约束二元优化问题,映射到伊辛玻璃自旋系统,用能量作为下游性能的廉价代理,从而无需逐一基准测试即可筛选大量候选配置。
推荐理由:把剪枝块选择映射为伊辛玻璃能量最小化,用物理求解器处理组合问题,在深度压缩下显著领先现有方法。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,Qwen3-VL 吞吐量比 GB300 NVL72 最高提升 3.7 倍,DeepSeek-R1 最高提升 2.5 倍。GB300 NVL72 在 288 GPU 规模下实现 99% 扩展效率,软件优化带来最高 1.6 倍性能提升。Nebius 等 19 家合作伙伴也提交了结果。
推荐理由:原文给出 Vera Rubin NVL72 在 MLPerf 推理基准上的首秀成绩与对比数据,读者可据此评估新一代平台的推理性能与扩展效率。
Google 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线强化学习将属性对齐的查询扇出编译为监督信号,并蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归推理,无需测试时思维 token。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,解决零样本 LLM 的释义坍缩与自回归延迟瓶颈。
OpenAI 推出 GPT-6 Astra,定位其最具商业能力的模型,具备高级推理、计算机使用能力,以及更强的写作与设计判断力。该模型面向工作场景,旨在提升企业级任务的智能化水平。
OpenAI 分享了一个由 AI 生成的 Navier–Stokes 千禧年大奖问题解法,包含问题论述和一份 Lean 形式化证明。该解法以 AI 生成的方式呈现,并附有形式化验证,但尚未提及是否通过官方评审或正式获奖。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。
Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。
推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个尺寸,均基于 Granite-4.1 基座模型后训练而来,采用多阶段强化学习流水线,其中 8B 和 30B 额外经过智能体强化学习,可在真实沙箱环境中调用工具、编辑代码、操作终端和搜索网页。所有模型均支持思考与非思考模式切换、低努力思考模式及原生工具调用,以 Apache 2.0 协议开源。
推荐理由:IBM 官方详解 Granite 4.2 推理模型家族的构建过程,读者可借此了解其多阶段强化学习与智能体训练的具体做法。
Multiverse Computing 发布论文《Quantization-Aware Healing》,提出从压缩前原模型直接蒸馏的修复方法,应用于 GPT-OSS 120B 压缩至 60B 并量化到 MXFP4 后,在 7/9 基准上超越其 bfloat16 版本,其中长上下文推理 +7.4、数学 +5.6。
推荐理由:论文提出从压缩前原模型蒸馏的修复方法,让 4-bit 模型在多数基准上反超自身 bfloat16 版本,并对比了与 QAT 的稳定性差异。
Liquid AI 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在 GPU 上实现最高 3.18 倍吞吐提升,端侧最高 2.87 倍,且不改变输出质量。LFM2.5-2.6B 的函数调用延迟平均降低 57%,并已开源支持 llama.cpp 和 SGLang。
推荐理由:原文给出了三款草稿模型的加速数据和接入方式,读者可据此评估投机解码带来的实际收益。
IBM 研究团队发布 ALTK-Evolve 相关研究,探讨智能体需要多少记忆。在八款模型上的 AppWorld 评测显示,强模型适合完整指南集,弱模型适合精简核心加按任务检索,饱和模型无增益。gpt-oss-120b 用精选检索在仅增加 5% token 时提升 16.1 个百分点任务完成率,提示缓存可降低生产环境成本。
推荐理由:原文用八模型实测说明智能体记忆并非越多越好,剂量需按模型能力校准,并给出成本数据。
Microsoft Research 推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离和打结五类任务,并区分静态推理与交互规划两个认知层级。
Google Research 提出知识画像框架,将事实状态分为编码失败、召回失败等五类,并发布 WikiProfile 基准,含 2,150 条维基百科事实。
推荐理由:论文用知识画像框架区分编码与召回失败,指出前沿模型的事实错误主要来自知识难以访问而非缺失,并验证了思考机制能恢复部分已编码事实。
IBM Research 在博客中介绍 ALTK-Evolve,一种让智能体从自身轨迹中学习经验并回注推理时的记忆方法,与 ACE 相比不压缩经验而是按需检索。
推荐理由:原文对比了两种智能体记忆方案的 token 开销差异,读者可据此判断按需检索相比全量注入的成本优势。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以其实例化 Science One Framework 自主科研原型,配套 CoE Audit 审计指标。
推荐理由:原文给出可验证性框架与审计方法,读者可据此判断自主科研智能体输出的可信度如何被量化。
微软研究院发布 EvoLib 框架,让大语言模型在推理过程中从自身经验中学习,无需真值标签或外部反馈,将过往尝试转化为可复用的技能和反思性洞察。EvoLib 通过整合与动态加权机制持续精炼知识,在数学推理、代码编写和长程决策任务上优于顶级检索式记忆方法,且对任务顺序具有鲁棒性。代码和实验结果已在 GitHub 上公开。
推荐理由:原文给出了将经验转化为可复用知识的具体机制和跨任务评测结果,读者可据此判断这类记忆进化方法相对传统检索记忆的实际收益。
Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。
推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。
Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。
推荐理由:原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。
Google Research 在 Nature 发表论文,提出用强化学习框架让自主智能体从量子错误检测中持续学习,动态调控数千个控制参数,在计算过程中稳定量子系统对抗漂移。在 Willow 处理器上,该方法将逻辑稳定性提升 3.5 倍,并在专家校准后进一步将逻辑错误率降低 20%。
推荐理由:原文展示了强化学习如何让量子计算机在运行中持续校准,读者可借此理解机器学习在量子纠错中的新角色。
Google Research 在 ICLR 2026 发表论文,从数学上解释扩散模型的“创造力”并非偶然,而是源于神经网络训练中正则化导致的“分数平滑”效应。该效应使模型在去噪过程中生成训练数据点之间的插值样本,而非简单记忆。研究还发现,即使不显式使用权重衰减,梯度算法带来的隐式正则化也能产生同样效果。
Hugging Face 发布 PyTorch 性能剖析系列第三篇,用 profiler 对比朴素注意力、原地掩码、SDPA 的 math、efficient、flash 和 cuDNN 后端。
推荐理由:用可复现脚本逐层对比注意力各实现的 profiler 足迹,能帮读者建立先猜测再验证的调优习惯。
Mistral 发布 Leanstral 1.5,一款 Apache-2.0 许可、总参数 119B 但仅 6B 激活的开源模型,在 miniF2F 上达到 100%,解决 PutnamBench 587/672 题,并在 FATE-H(87%)和 FATE-X(34%)上取得新 SOTA。
推荐理由:原文给出了基准成绩、成本对比和真实代码库找 bug 的案例,读者可据此判断它在形式化验证上的实用程度。
Hugging Face 团队提出 DiScoFormer(Density and Score Transformer),单个模型在一次前向传播中即可估计任意数据集的密度与分数,无需针对每个分布重新训练。
Google Research 宣布一种新架构,将多 token 预测(MTP)头附加到冻结的 Gemini Nano v3 模型上,以加速 Pixel 9 和 10 系列上的端侧推理。相比独立草稿模型,MTP 在 Pixel 9 上带来 50% 或以上的速度提升,并节省约 130MB 内存,同时保持输出与主模型逐位一致。该方案已用于 AI 通知摘要和校对等功能,减少能耗并提升电池续航。
推荐理由:原文给出冻结骨干加 MTP 头的端侧加速方案,读者可据此判断其相对独立草稿模型的效率优势。
Google Research 在 COLM 2026 发表的论文中,通过受控实验证明允许模型生成推理轨迹能解锁原本无法获取的正确事实答案。研究识别出计算缓冲和事实启动两种互补机制,并发现推理轨迹中若含单个幻觉中间事实会显著降低最终答案正确率。基于此,研究提出在测试时优先保留无幻觉事实的推理轨迹可提升准确率,并建议训练时用过程奖励鼓励事实支持的中间步骤。
推荐理由:原文用受控实验拆解了推理为何能解锁参数化知识,并给出可落地的训练优化方向。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。
推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。
谷歌的 Co-Scientist 正在帮助 MIT 的 Ritu Raman 和波士顿儿童医院的 Ryan Flynn 加速 ALS 研究。该工具将 Raman 的活体神经肌肉组织模型与 Flynn 的细胞表面 RNA 图谱相结合,把数月文献梳理压缩为快速假设生成与排序。两人正借此寻找新型 RNA 机制,探索针对 ALS 的 RNA 药物。
斯坦福大学遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选肝纤维化候选药物,在活体人类肝细胞测试中,Co-Scientist 选出的三种候选药有两种能阻断纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的损伤反应,而 Peltz 自行挑选的两种药物均未见效果。
推荐理由:原文呈现了AI智能体在药物重定位中的具体实验结果,读者可据此评估其在该领域的实际价值。
Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。
推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。
Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中提炼高层结构化推理记忆的智能体框架,用于测试时自我进化。
推荐理由:原文给出了 ReasoningBank 在 WebArena 和 SWE-Bench-Verified 上的成功率与效率提升数据,读者可据此判断该记忆框架的实际收益。
GRASP 是一种面向学习型动力学(世界模型)的新型梯度规划器,通过将轨迹提升至虚拟状态实现跨时间并行优化、直接向状态迭代添加随机性以增强探索,并重塑梯度以避免高维视觉模型中的脆弱“状态输入”梯度,使长视野规划变得实用。
Google Research 推出压缩算法 TurboQuant,通过结合 PolarQuant 与 QJL 技术,在实现高压缩率的同时保持零精度损失,旨在解决向量量化中的内存开销问题,并缓解 KV 缓存瓶颈。
Mistral 发布 Mistral Small 4,这是首个统一旗舰模型能力的开源模型,融合 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力。
推荐理由:原文给出了架构、性能提升和开放入口,读者可以据此判断它如何统一推理、多模态与编码能力。