微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
微软研究团队在 Nature 发表逆合成预测模型 RetroChimera,结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习排序整合两者预测。盲测中博士级化学家更偏好其单步反应预测,多步合成路线在十个挑战性目标中成功九个。模型已开源(MIT 许可),并可通过 Microsoft Foundry 访问。
推荐理由:原文给出了模型架构、开源信息和专家盲测结果,读者可据此判断它在逆合成预测上的实际表现。
微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数编码器压缩为 22M 参数的 ViT-S 骨干,在保持约 97% 预测性能的同时将全切片分析计算量降低约 50 倍,空间蛋白组学预测提速约 6 倍、显存减少约 8 倍。两模型均以 Apache 2.0 协议开放权重,代码与权重已上架 Hugging Face,面向科研用途而非临床诊疗。
推荐理由:原文给出了蒸馏压缩后的效率提升和开放权重入口,读者可据此评估病理基础模型在更大队列研究中的实用成本。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol,精度超越主流全局杂化泛函。Skala 现已集成至 CP2K,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。
推荐理由:微软研究院发布 Skala 1.1,训练数据扩充 2.5 倍,并推进多款量子化学软件的集成,读者可据此评估其精度与可用性。
Microsoft Research 推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离和打结五类任务,并区分静态推理与交互规划两个认知层级。
微软研究院发布 CARE-X,一个面向胸部 X 光临床解读的统一视觉语言模型,结合生成式报告与结构化预测,并采用 DAPO 强化学习优化临床正确性。在 Chest ImaGenome 异常分类上,CARE-X 辅助头在阈值 0.5 时达到 0.943 灵敏度,在 ReXVQA 基准上以 94% 准确率排名第一。
推荐理由:原文展示了辅助监督与奖励对齐如何提升放射学视觉语言模型的临床实用性,并给出工具增强测量带来的显著性能提升。
微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。
推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。
微软研究院发布 Echoverse,一套为计算机使用智能体构建的深度演化训练环境,包含十个深度领域世界和两个能力世界。用全部十二个世界训练后,9B 模型得分从 36.5% 提升到 67.1%,接近 GPT-5.4。实验表明浅层环境会拖累模型,深度环境才能迁移;强化学习相对模仿学习能进一步提升留出集表现。微软开源了其中四个世界及其代码、数据和基于数据库的评分器。
推荐理由:原文给出了深度合成环境对计算机使用智能体的训练收益,以及浅层环境反而拖累能力的对比证据,可据此判断训练数据质量与规模哪个更关键。
微软研究院发布 EvoLib 框架,让大语言模型在推理过程中从自身经验中学习,无需真值标签或外部反馈,将过往尝试转化为可复用的技能和反思性洞察。EvoLib 通过整合与动态加权机制持续精炼知识,在数学推理、代码编写和长程决策任务上优于顶级检索式记忆方法,且对任务顺序具有鲁棒性。代码和实验结果已在 GitHub 上公开。
推荐理由:原文给出了将经验转化为可复用知识的具体机制和跨任务评测结果,读者可据此判断这类记忆进化方法相对传统检索记忆的实际收益。