Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。编码能力较前代大幅跃升,Terminal-Bench 4.0 得分从 10.3% 升至 70.6%,CursorBench 4.0 得分 55.5%,仅比 Opus 5.5 低约两分。
推荐理由:原文给出了 Sonnet 5.5 与 Opus 5.5 及前代的基准对比和定价,读者可据此判断中端模型的实际性价比。
GPT-6 Astra 完成 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。其对用户意图更强的理解能力,让 Basis 在实际应用中更有信心。
AWS 提出一种结合 Amazon EKS、EFA 与 DeepEP 的架构,用于加速大规模 MoE 模型的强化学习后训练,吞吐量提升 40%。该方案重点优化专家并行(EP)带来的动态 all-to-all 通信,并协调 rollout 生成与策略训练之间的异构算力需求。文章分析了 RL 训练在算力、内存与网络带宽上的三重挑战,以及 PPO 与 GRPO 两类流程的共性基础设施压力。
AWS 展示了如何在 SageMaker HyperPod 上运行开源 RL 框架 SkyRL,以 GRPO 算法训练 Qwen3-VL-8B 视觉语言模型导航视觉迷宫。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。相比 Opus 5,它用更少 token 完成任务,平均单任务成本更低,并首次配备生物、网络安全和 AI 开发领域的安全分类器。模型支持自适应思考,可通过 effort 控制推理量,适用于智能体编码和长文档知识工作。
推荐理由:原文给出了新模型的效率、定价与安全分类器变化,读者可据此评估其在长任务和智能体编码场景的适用性。
Multiverse Computing 发表论文,将大语言模型的块删除(深度剪枝)重构为约束二元优化问题,映射到伊辛玻璃自旋系统,用能量作为下游性能的廉价代理,从而无需逐一基准测试即可筛选大量候选配置。
推荐理由:把剪枝块选择映射为伊辛玻璃能量最小化,用物理求解器处理组合问题,在深度压缩下显著领先现有方法。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,Qwen3-VL 吞吐量比 GB300 NVL72 最高提升 3.7 倍,DeepSeek-R1 最高提升 2.5 倍。GB300 NVL72 在 288 GPU 规模下实现 99% 扩展效率,软件优化带来最高 1.6 倍性能提升。Nebius 等 19 家合作伙伴也提交了结果。
推荐理由:原文给出 Vera Rubin NVL72 在 MLPerf 推理基准上的首秀成绩与对比数据,读者可据此评估新一代平台的推理性能与扩展效率。
Google 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线强化学习将属性对齐的查询扇出编译为监督信号,并蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归推理,无需测试时思维 token。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,解决零样本 LLM 的释义坍缩与自回归延迟瓶颈。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。
Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。
推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。
Microsoft Research 推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离和打结五类任务,并区分静态推理与交互规划两个认知层级。
Google Research 提出知识画像框架,将事实状态分为编码失败、召回失败等五类,并发布 WikiProfile 基准,含 2,150 条维基百科事实。
推荐理由:论文用知识画像框架区分编码与召回失败,指出前沿模型的事实错误主要来自知识难以访问而非缺失,并验证了思考机制能恢复部分已编码事实。
微软研究院发布 EvoLib 框架,让大语言模型在推理过程中从自身经验中学习,无需真值标签或外部反馈,将过往尝试转化为可复用的技能和反思性洞察。EvoLib 通过整合与动态加权机制持续精炼知识,在数学推理、代码编写和长程决策任务上优于顶级检索式记忆方法,且对任务顺序具有鲁棒性。代码和实验结果已在 GitHub 上公开。
推荐理由:原文给出了将经验转化为可复用知识的具体机制和跨任务评测结果,读者可据此判断这类记忆进化方法相对传统检索记忆的实际收益。
Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。
推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。
Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。
推荐理由:原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。
Google Research 在 ICLR 2026 发表论文,从数学上解释扩散模型的“创造力”并非偶然,而是源于神经网络训练中正则化导致的“分数平滑”效应。该效应使模型在去噪过程中生成训练数据点之间的插值样本,而非简单记忆。研究还发现,即使不显式使用权重衰减,梯度算法带来的隐式正则化也能产生同样效果。
Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。
推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。
GRASP 是一种面向学习型动力学(世界模型)的新型梯度规划器,通过将轨迹提升至虚拟状态实现跨时间并行优化、直接向状态迭代添加随机性以增强探索,并重塑梯度以避免高维视觉模型中的脆弱“状态输入”梯度,使长视野规划变得实用。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 中的关键交互。SPEX 利用稀疏性和低阶性将搜索问题转化为稀疏恢复问题,在数千特征规模下保持高忠实度;ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。