跳到正文

#Agent

今日 14 条
9月21日周一
  1. NVIDIA Blog42

    AI 安全是工程问题:NVIDIA 如何在智能体栈每一层解决它

    NVIDIA 提出 AI 安全本质是工程问题,需在智能体栈的每一层(模型、工具、运行时环境)落实可执行的安全边界、责任人与防护证据。NVIDIA 开源 OpenShell 安全运行时,在智能体触及范围之外强制策略并提供沙箱执行;Cisco DefenseClaw、JFrog 等合作伙伴正基于 OpenShell 构建治理与技能扫描层。

9月18日周五
9月17日周四
9月16日周三
9月15日周二
9月14日周一
9月12日周六
  1. GitHub Blog · AI & ML60

    GitHub 日本韩国市场负责人:用 GitHub Copilot 把活动运营从策划到跟进全流程自动化

    GitHub 日韩市场负责人 Tomoko Tanaka 分享如何用 GitHub Copilot 将活动运营自动化:从单个 GitHub Issue 自动搭建落地页、生成 UTM 链接、每日筛选报名者,到会后用 /lead-upload 和 /event-report 两个斜杠命令完成 CRM 上传和报告。

    推荐理由:作者用 GitHub Copilot 把活动运营流程自动化,给出了从 Issue 表单到 Skills 的完整可迁移方法。

9月11日周五
9月10日周四
9月9日周三
  1. Mistral AI62

    Mistral 用 AI 智能体将 4 万行 Fortran 77 迁移到 C++ 的实践

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 物理模拟器迁移到 C++,并总结了可复用的方法。项目先构建数值一致性校验框架,再用 Vibe CLI 生成调用树并派上百个智能体整理文档,最后采用人工把关的规划、编码、测试、审查智能体工作流逐模块迁移。

    推荐理由:原文给出了用智能体迁移遗留代码的完整工作流和三条可复用原则,读者可直接借鉴到同类项目。

9月7日周一
9月5日周六
  1. GitHub Blog · AI & ML78

    GitHub 推出 Project HydraFusion 研究预览,通过多模型编排实现前沿质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型中选择执行计划,以平衡质量、成本与延迟。它支持 Single、Cascade、Critique 三种执行模式,在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点且成本降低 67%。

    推荐理由:原文给出了多模型编排的三种执行模式与基准测试结果,读者可据此判断它在质量与成本之间的取舍。

9月4日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot app 入门:如何同时运行多个智能体

    GitHub Copilot app 支持在同一项目上并行运行多个 AI 智能体会话,每个会话独立执行任务、互不干扰,并拥有各自的 Git worktree 和上下文,用户可随时切换且无需重新解释。通过 sessions view 可同时跟踪多个任务进度,例如在示例仓库 tailspin-toys 中并行实现 funded sort 功能、可访问性审查和测试运行,从而减少等待和上下文切换时间。

9月3日周四
  1. Hugging Face Blog82

    Hugging Face 发布 funes:为编码智能体提供本地持久记忆层

    Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi 和 Hermes 等编码智能体提供本地持久记忆层。它从智能体已有会话日志构建索引,支持 recall 和 get 工具,默认本地运行,也可绑定到私有 Hugging Face 数据集跨机器共享。基准测试显示 recall 比手写交接便宜 8 倍和 4 倍。

    推荐理由:原文给出了安装命令、跨智能体记忆机制和基准对比,读者可据此判断它能否解决自己切换智能体时丢失上下文的问题。

  2. Google DeepMind62

    Google DeepMind 推出 Fairwind 计划,向政府和合作伙伴开放高级网络防御能力

    Google DeepMind 今日推出 Fairwind 计划,这是一个面向政府和受信任合作伙伴的有限访问项目,提供其最先进的网络防御能力。该计划首先让防御者使用 Gemini 3.8 Flash Cyber 模型和 CodeMender 工具,自主发现并修复漏洞,在组织安全云环境中几分钟内生成可部署的补丁。

    推荐理由:原文给出了 Fairwind 计划的准入对象、能力组合和开放范围,读者可据此判断该计划对自身组织的适用性。

9月2日周三
9月1日周二
8月26日周三
  1. GitHub · Open WebUI62

    Open WebUI v0.11.1 发布:新增人工审批工具调用与多项性能优化

    Open WebUI 发布 v0.11.1,新增人工审批工具调用功能,管理员开启后可在对话中逐次允许或拒绝模型使用工具;模型还可暂停并提问最多三个选择题。同时重构了流式传输,长回复数据传输量最高减少 1000 倍,并修复了知识库越权访问、文档解压炸弹等多项安全漏洞,建议生产环境尽快升级。

8月25日周二
  1. Hugging Face Blog75

    IBM 发布 Granite 4.2 推理模型家族:3B、8B、30B 三档开源

    IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个尺寸,均基于 Granite-4.1 基座模型后训练而来,采用多阶段强化学习流水线,其中 8B 和 30B 额外经过智能体强化学习,可在真实沙箱环境中调用工具、编辑代码、操作终端和搜索网页。所有模型均支持思考与非思考模式切换、低努力思考模式及原生工具调用,以 Apache 2.0 协议开源。

    推荐理由:IBM 官方详解 Granite 4.2 推理模型家族的构建过程,读者可借此了解其多阶段强化学习与智能体训练的具体做法。

8月21日周五
  1. Google DeepMind42

    从 Atari 到 EVE Online:Google DeepMind 如何延续 15 年游戏 AI 研究

    Google DeepMind 宣布与 Fenris Creations 及 EVE Universe 等游戏开发商建立新研究合作,继续以游戏推动 AI 突破。其 SIMA 2 智能体由 Gemini 驱动,能通过屏幕、自然语言指令和键鼠操作实现类人游戏水平,无需 API 或源码访问。此前 DQN、AlphaGo、AlphaZero、AlphaStar 等成果已多次推动强化学习与通用系统发展。

8月19日周三
  1. Hugging Face Blog62

    IBM 研究:智能体记忆剂量需按模型能力校准,而非简单累积

    IBM 研究团队发布 ALTK-Evolve 相关研究,探讨智能体需要多少记忆。在八款模型上的 AppWorld 评测显示,强模型适合完整指南集,弱模型适合精简核心加按任务检索,饱和模型无增益。gpt-oss-120b 用精选检索在仅增加 5% token 时提升 16.1 个百分点任务完成率,提示缓存可降低生产环境成本。

    推荐理由:原文用八模型实测说明智能体记忆并非越多越好,剂量需按模型能力校准,并给出成本数据。

8月14日周五
  1. Hugging Face Blog70

    Hugging Face 发布 2026 夏季开源模型生态观察报告

    Hugging Face 发布 2026 年夏季开源模型生态半年报告,覆盖 1 至 8 月的观察。报告指出中国实验室前沿模型规模持续领先,美国厂商则更多通过 AMD、NVIDIA 等硬件公司发布开源模型;下载与点赞反映不同信号,Qwen 以 151,448 个衍生模型成为社区基础模型,小模型占据 83% 的历史下载量,智能体首次成为 Hub 第一大用户。

    推荐理由:报告用 Hub 下载、点赞与衍生模型数据拆解开源生态的结构性变化,可帮助读者理解前沿模型与基础设施之间的真实关系。

8月13日周四
  1. Hugging Face Blog82

    Hugging Face 社区用智能体复现 ICML 2026 论文 2226 篇

    Hugging Face 于 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战赛,1221 名社区成员使用各自编码智能体复现了 2226 篇论文,占会议论文的 34%,共发布 6816 份 Trackio 日志。

    推荐理由:原文给出了大规模复现实验的完整数据与具体案例,读者可以据此判断AI智能体参与科研评审的实际效果与局限。

8月11日周二
8月10日周一
  1. Hugging Face Blog85

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 今日发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,专为本地智能体场景设计,采用 Apache 2.0 许可。模型由 2B 视觉编码器和 28B 文本解码器组成,支持图像、视频输入及多模态工具调用,并附带 DFlash 投机解码加速。

    推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可据此评估它在端侧智能体场景的适用性。

8月4日周二
  1. Microsoft Research80

    微软开源 Orchard 智能体训练框架,Orchard-SWE 在 SWE-bench Verified 达 69.7%

    微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。

    推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。

7月31日周五
  1. Microsoft Research78

    微软 Echoverse:为计算机使用智能体构建深度演化训练环境

    微软研究院发布 Echoverse,一套为计算机使用智能体构建的深度演化训练环境,包含十个深度领域世界和两个能力世界。用全部十二个世界训练后,9B 模型得分从 36.5% 提升到 67.1%,接近 GPT-5.4。实验表明浅层环境会拖累模型,深度环境才能迁移;强化学习相对模仿学习能进一步提升留出集表现。微软开源了其中四个世界及其代码、数据和基于数据库的评分器。

    推荐理由:原文给出了深度合成环境对计算机使用智能体的训练收益,以及浅层环境反而拖累能力的对比证据,可据此判断训练数据质量与规模哪个更关键。

  2. Microsoft Research62

    微软研究院发布 EvoLib 框架,将经验转化为可进化的知识库

    微软研究院发布 EvoLib 框架,让大语言模型在推理过程中从自身经验中学习,无需真值标签或外部反馈,将过往尝试转化为可复用的技能和反思性洞察。EvoLib 通过整合与动态加权机制持续精炼知识,在数学推理、代码编写和长程决策任务上优于顶级检索式记忆方法,且对任务顺序具有鲁棒性。代码和实验结果已在 GitHub 上公开。

    推荐理由:原文给出了将经验转化为可复用知识的具体机制和跨任务评测结果,读者可据此判断这类记忆进化方法相对传统检索记忆的实际收益。