跳到正文

全部动态

今日 4 条
今天9月29日周二
  1. The Verge · AI40

    Engram 采样器:将 AI 幻觉变成音乐

    音乐初创公司 Thoughtful Things 为旗下首款乐器 Engram 发起 Kickstarter 众筹。这是一款采样器与律动工作站,利用本地运行的“微型 AI”处理输入音频,甚至能幻觉出全新声音,旨在探索实验性音色而非生成流行歌曲。其模型基于仅含商用授权音频的开放数据集自研训练,公司计划开源固件,众筹限量版起价 $675。

  2. TechCrunch · AI47

    Google 关停 Gemini 的 Gems,将其迁移为“skills”

    Google 宣布关停 Gemini 的 Gems 功能,用户创建的 Gems 将自动迁移为可跨任务使用的“skills”,无需用户手动操作,迁移自 2026 年 11 月 17 日起生效。Gems 于 2024 年推出,旨在让用户无需重复指令即可定制 AI 助手,但新交互需在任务线程中输入“/”选择技能,对普通用户不够友好。

  3. AWS Machine Learning Blog70

    Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度

    xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。

    推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。

9月28日周一
  1. The Decoder62

    英伟达推出内置芯片的智能体看门狗 Sentry

    英伟达推出智能体安全看门狗 Sentry,作为 BlueField-4 DPU 的参考设计,与主计算分离运行,可在智能体试图越界时于毫秒内隔离。Sentry 结合 3 月开源的 OpenShell 沙箱和 9 月 10 日推出的形式化验证工具,用于检测权限是否越限。英伟达称兼容系统只需软件更新即可启用,但未公布独立上市日期,也未给出检测可靠性数据。

  2. The Verge · AI62

    Nvidia 推出 Open Agent Safety Platform,可在毫秒内隔离越界 AI 智能体

    Nvidia 推出新的 Open Agent Safety Platform,用于监控和隔离 AI 智能体,可在毫秒内隔离试图越界的智能体。该平台基于 Nvidia 的 OpenShell 开源软件,运行在 Vera AI CPU 上,用户可选择智能体可访问的信息,OpenShell 在任务前和任务中检查这些限制,并借助独立芯片上的 Sentry 技术持续监控和执行边界。

9月26日周六
9月25日周五
  1. Google DeepMind62

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为对话模型加入实时视频形象

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成能力,可边听边看边用动态视觉形象说话。该功能支持精确唇形同步、自然表情和流畅轮换,并可在后台异步调用工具的同时保持对话不中断。即日起在 Gemini Enterprise 中可用,支持跨 97 种语言无缝切换,所有输出均带 SynthID 水印。

    推荐理由:原文给出了实时视频形象、异步工具调用和 97 语言同步等能力细节,读者可据此判断企业客服等场景的落地方式。

9月24日周四
  1. Ars Technica · AI65

    Meta 将 AI 助手 Muse 带上眼镜,推出无摄像头 Ray-Ban 与轻量 VR 眼镜

    Meta 宣布将 AI 助手 Muse 引入其眼镜产品,并推出无摄像头的 Ray-Ban 音频眼镜及多款新镜框,同时发布比 Quest 3 轻五倍、售价 1300 美元的 VR 眼镜。Muse 助手将支持超逼真数字替身用于视频通话,但公司需说服用户连接个人数据,且已修复可被黑客控制 Muse 代理的漏洞,亚马逊也阻止了其代理访问购物平台。

  2. Ars Technica · AI28

    YouTube 承诺今年晚些时候推出自定义信息流和更多 AI 功能

    YouTube 在年度 Made on YouTube 活动上预告了未来数月将上线的新功能,包括面向观众和创作者的大量 AI 更新。平台将推出 Custom Feeds,用户可通过输入描述创建个性化标签页,并支持保存“多个”信息流,该功能即将在美国的网页、移动端和电视端上线。此外,评论框将支持发布 GIF,私信功能也将新增群聊支持,后者初期仅在美国、英国、新加坡、巴西及部分欧洲国家可用。

  3. Google DeepMind62

    Google 为 Private AI Compute 引入安全服务端内存,实现跨设备持久记忆

    Google 公布 Private AI Compute 架构更新,新增安全服务端内存层,让 AI 助手在云端获得跨设备持久记忆,同时保持设备端隐私标准。数据被密封在加密存储中,解锁密钥仅存于个人设备,即使 Google 也无法访问;处理时通过端到端加密通道在安全隔离区临时解密,随后立即重新加密。Google 还发布了防篡改的服务器软件公开记录及独立安全审计结果,供社区验证。

    推荐理由:原文给出了加密存储与设备端密钥分离的架构细节,读者可据此判断云端持久记忆的隐私边界。

9月23日周三
  1. Google DeepMind75

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建自定义角色声音、逐行导演表演,并覆盖 100 多种语言。

    推荐理由:原文给出了两款新语音模型的能力边界、开放入口和评测排名,读者可据此判断其适用场景。

9月22日周二
  1. NVIDIA Blog62

    NVIDIA Isaac ROS 5.0 发布,引入智能体工作流并支持 ROS Lyrical

    NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速开源包,新增智能体工作流和平台支持,帮助开发者更快构建、定制和部署机器人应用。

    推荐理由:原文给出了 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持和生态伙伴落地案例,读者可据此判断它如何加速机器人开发。

  2. Hugging Face Blog73

    Hugging Face transformers 支持运行 llama.cpp 的 GGUF 量化模型

    Hugging Face 在 transformers 中加入对 GGUF 模型的高效运行支持,通过复用 ggml 的 Metal 内核,可在 Apple Silicon 上以熟悉的 from_pretrained 接口加载并生成。

    推荐理由:原文给出了 GGUF 加载方式、性能对比和当前限制,读者可以据此判断在 transformers 里跑本地量化模型的可行性与适用场景。

9月21日周一
9月17日周四
9月8日周二
  1. Google DeepMind83

    Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组全部单核苷酸变异影响

    Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组中 90 亿个单核苷酸变异的分子效应预测,并推出 AVI 评分用于快速排序变异影响。该平台以 1PB 数据集形式提供,面向学术研究免费开放,可通过网站门户、AlphaGenome API 及 Google Antigravity 技能访问,商业用途即将在 Google Cloud 上线。

    推荐理由:原文给出了覆盖全基因组 90 亿单核苷酸变异的预测平台及其开放入口,读者可据此判断它在罕见病和复杂性状研究中的可用范围。

9月5日周六
  1. GitHub Blog · AI & ML78

    GitHub 推出 Project HydraFusion 研究预览,通过多模型编排实现前沿质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型中选择执行计划,以平衡质量、成本与延迟。它支持 Single、Cascade、Critique 三种执行模式,在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点且成本降低 67%。

    推荐理由:原文给出了多模型编排的三种执行模式与基准测试结果,读者可据此判断它在质量与成本之间的取舍。

9月3日周四
  1. Hugging Face Blog82

    Hugging Face 发布 funes:为编码智能体提供本地持久记忆层

    Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi 和 Hermes 等编码智能体提供本地持久记忆层。它从智能体已有会话日志构建索引,支持 recall 和 get 工具,默认本地运行,也可绑定到私有 Hugging Face 数据集跨机器共享。基准测试显示 recall 比手写交接便宜 8 倍和 4 倍。

    推荐理由:原文给出了安装命令、跨智能体记忆机制和基准对比,读者可据此判断它能否解决自己切换智能体时丢失上下文的问题。

  2. Google DeepMind62

    Google DeepMind 推出 Fairwind 计划,向政府和合作伙伴开放高级网络防御能力

    Google DeepMind 今日推出 Fairwind 计划,这是一个面向政府和受信任合作伙伴的有限访问项目,提供其最先进的网络防御能力。该计划首先让防御者使用 Gemini 3.8 Flash Cyber 模型和 CodeMender 工具,自主发现并修复漏洞,在组织安全云环境中几分钟内生成可部署的补丁。

    推荐理由:原文给出了 Fairwind 计划的准入对象、能力组合和开放范围,读者可据此判断该计划对自身组织的适用性。

9月2日周三
  1. Google DeepMind80

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,可将 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。

    推荐理由:官方给出了 token 与成本降幅和准确率提升的具体数字,读者可据此判断该功能对长视频分析的实际价值。

8月28日周五
  1. Google Research62

    Google Earth AI 推出行星预测引擎 PPE,自主完成地理空间建模全流程

    Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。

    推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。

8月27日周四
  1. Google DeepMind62

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在加密环境中,防止模型提前看到测试题。该评测与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,用 Gemini Flash Lite 模型在隐私保护环境中测试机密基准,以提升评测完整性。

    推荐理由:原文介绍了用加密环境做双盲评测的具体做法,读者可借此理解如何缓解基准污染、提升评测可信度。

8月20日周四
  1. Mistral AI72

    Mistral 发布 Agentic Search,提升复杂文档检索准确率并降低延迟

    Mistral 发布 Agentic Search,一个多步骤检索层,让模型能搜索、导航、读取并验证复杂文档中的信息。在 FinanceBench 上,准确率从 26.7% 提升至 86%,OfficeQA Pro 上提升 45.6 个百分点;p90 延迟降低最多 39.6%,token 消耗减少三分之一。

    推荐理由:官方给出了基准测试的准确率、延迟和 token 消耗数据,读者可据此判断 Agentic Search 相比传统 RAG 的实际收益。

7月30日周四
  1. Google DeepMind55

    Google DeepMind 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。

7月13日周一