Engram 采样器:将 AI 幻觉变成音乐
音乐初创公司 Thoughtful Things 为旗下首款乐器 Engram 发起 Kickstarter 众筹。这是一款采样器与律动工作站,利用本地运行的“微型 AI”处理输入音频,甚至能幻觉出全新声音,旨在探索实验性音色而非生成流行歌曲。其模型基于仅含商用授权音频的开放数据集自研训练,公司计划开源固件,众筹限量版起价 $675。
音乐初创公司 Thoughtful Things 为旗下首款乐器 Engram 发起 Kickstarter 众筹。这是一款采样器与律动工作站,利用本地运行的“微型 AI”处理输入音频,甚至能幻觉出全新声音,旨在探索实验性音色而非生成流行歌曲。其模型基于仅含商用授权音频的开放数据集自研训练,公司计划开源固件,众筹限量版起价 $675。
Google 宣布关停 Gemini 的 Gems 功能,用户创建的 Gems 将自动迁移为可跨任务使用的“skills”,无需用户手动操作,迁移自 2026 年 11 月 17 日起生效。Gems 于 2024 年推出,旨在让用户无需重复指令即可定制 AI 助手,但新交互需在任务线程中输入“/”选择技能,对普通用户不够友好。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
Nvidia 在周一发布 Open Agent Safety Platform,通过 OpenShell 软件边界与运行在 BlueField-4 上的 Sentry 监控系统,为 AI 智能体提供独立于 CPU/GPU 的硬件级安全层,可在毫秒内隔离越界行为。该平台已获 Anthropic、Arm、Microsoft、Oracle、SpaceX 等多家公司支持,OpenAI 未在参与名单中。
英伟达推出智能体安全看门狗 Sentry,作为 BlueField-4 DPU 的参考设计,与主计算分离运行,可在智能体试图越界时于毫秒内隔离。Sentry 结合 3 月开源的 OpenShell 沙箱和 9 月 10 日推出的形式化验证工具,用于检测权限是否越限。英伟达称兼容系统只需软件更新即可启用,但未公布独立上市日期,也未给出检测可靠性数据。
Nvidia 推出新的 Open Agent Safety Platform,用于监控和隔离 AI 智能体,可在毫秒内隔离试图越界的智能体。该平台基于 Nvidia 的 OpenShell 开源软件,运行在 Vera AI CPU 上,用户可选择智能体可访问的信息,OpenShell 在任务前和任务中检查这些限制,并借助独立芯片上的 Sentry 技术持续监控和执行边界。
gpt-load 发布 v2.0.0-rc.37,新增 Mistral 原生路由支持,并修复了 bifrost 协议下 provider base URL 语义不一致的问题。2.x 为全新重写版本,与 1.x 数据不兼容,需使用全新数据库和新的 encryption.key 部署。
LiteLLM v1.104.0-rc.1 发布,所有 Docker 镜像均使用 cosign 签名,并支持通过固定提交哈希或发布标签进行签名验证。该版本还包含多项修复,如 Azure code_interpreter 容器文件测试覆盖、预算 Redis 管道同步读取修复,以及将 SDK 回调迁移至 Langfuse v4。
LiteLLM v1.103.0 发布,所有 Docker 镜像均使用 cosign 签名,并支持通过固定 commit hash 或 release tag 进行签名验证。
Apache APISIX 发布 3.19.0 版本,由 shreemaan-abhishek 于 9 月 28 日发布。该版本包含多项更新,具体变更内容需查看标签对比或发布说明。
GPT-6 Astra 完成 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。其对用户意图更强的理解能力,让 Basis 在实际应用中更有信心。
OpenAI 正在收集使用 Codex 的开发者、研究者与创作者的真实故事,邀请他们参与 Codex Originals 项目下一篇章。如果你希望成为其中一员,可通过下方表单分享你的项目经历。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理方案,销售额提升 60%,节省 75 多小时。
Datacor 将 Amazon Quick Sight 集成进 TrackAbout 解决方案,为工业气体与焊接分销商提供自助式租赁分析,用户可通过交互式仪表盘和自然语言搜索直接查询租赁绩效数据,无需再提交 IT 工单或等待定制报告。
Runway 本月发布 GWM Worlds 2 研究预览,将高保真视频与音频生成转化为实时交互模拟,并引入新输入格式 WorldPrompt,可固定首帧并创建带时间戳的事件序列,支持实时提示。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成能力,可边听边看边用动态视觉形象说话。该功能支持精确唇形同步、自然表情和流畅轮换,并可在后台异步调用工具的同时保持对话不中断。即日起在 Gemini Enterprise 中可用,支持跨 97 种语言无缝切换,所有输出均带 SynthID 水印。
推荐理由:原文给出了实时视频形象、异步工具调用和 97 语言同步等能力细节,读者可据此判断企业客服等场景的落地方式。
Meta 宣布将 AI 助手 Muse 引入其眼镜产品,并推出无摄像头的 Ray-Ban 音频眼镜及多款新镜框,同时发布比 Quest 3 轻五倍、售价 1300 美元的 VR 眼镜。Muse 助手将支持超逼真数字替身用于视频通话,但公司需说服用户连接个人数据,且已修复可被黑客控制 Muse 代理的漏洞,亚马逊也阻止了其代理访问购物平台。
Remedy Entertainment 的《CONTROL Resonant》本周登陆 GeForce NOW 云游戏平台,终极会员可借 GeForce RTX 5080 级性能串流游玩,支持 DLSS 4、光线追踪、NVIDIA Reflex 与最高 5K HDR。
YouTube 在年度 Made on YouTube 活动上预告了未来数月将上线的新功能,包括面向观众和创作者的大量 AI 更新。平台将推出 Custom Feeds,用户可通过输入描述创建个性化标签页,并支持保存“多个”信息流,该功能即将在美国的网页、移动端和电视端上线。此外,评论框将支持发布 GIF,私信功能也将新增群聊支持,后者初期仅在美国、英国、新加坡、巴西及部分欧洲国家可用。
Google 公布 Private AI Compute 架构更新,新增安全服务端内存层,让 AI 助手在云端获得跨设备持久记忆,同时保持设备端隐私标准。数据被密封在加密存储中,解锁密钥仅存于个人设备,即使 Google 也无法访问;处理时通过端到端加密通道在安全隔离区临时解密,随后立即重新加密。Google 还发布了防篡改的服务器软件公开记录及独立安全审计结果,供社区验证。
推荐理由:原文给出了加密存储与设备端密钥分离的架构细节,读者可据此判断云端持久记忆的隐私边界。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建自定义角色声音、逐行导演表演,并覆盖 100 多种语言。
推荐理由:原文给出了两款新语音模型的能力边界、开放入口和评测排名,读者可据此判断其适用场景。
GPT-6 Astra 能生成结构更清晰、更贴合语境的 legal 文档,让律师得以专注于策略层面。Harvey 将这一模型能力应用于法律实务,提升了草稿质量。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 上正式可用,两者 API 定价均显著低于 GPT-5.6 前代。
推荐理由:原文给出了两款模型的分工定位、降价幅度和提示词缓存能力,读者可据此判断如何按负载匹配模型。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速开源包,新增智能体工作流和平台支持,帮助开发者更快构建、定制和部署机器人应用。
推荐理由:原文给出了 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持和生态伙伴落地案例,读者可据此判断它如何加速机器人开发。
Hugging Face 在 transformers 中加入对 GGUF 模型的高效运行支持,通过复用 ggml 的 Metal 内核,可在 Apple Silicon 上以熟悉的 from_pretrained 接口加载并生成。
推荐理由:原文给出了 GGUF 加载方式、性能对比和当前限制,读者可以据此判断在 transformers 里跑本地量化模型的可行性与适用场景。
Hugging Face 发布 tokenizers v1 的候选版本,编码路径比 v0.23 快 3 到 30 倍,在 Apple M4 Max 上八线程扩展效率为线性扩展的 76%,且输出 token ID 与旧版完全一致。
推荐理由:原文给出了 v1 相比 v0.23 的编码提速幅度和实现原理,读者可据此判断升级收益与适用场景。
Pawprint Studio 的开放世界抓宠 RPG《Aniimo》本周登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck、Firefox 浏览器等设备上串流游玩。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组中 90 亿个单核苷酸变异的分子效应预测,并推出 AVI 评分用于快速排序变异影响。该平台以 1PB 数据集形式提供,面向学术研究免费开放,可通过网站门户、AlphaGenome API 及 Google Antigravity 技能访问,商业用途即将在 Google Cloud 上线。
推荐理由:原文给出了覆盖全基因组 90 亿单核苷酸变异的预测平台及其开放入口,读者可据此判断它在罕见病和复杂性状研究中的可用范围。
GitHub 推出 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型中选择执行计划,以平衡质量、成本与延迟。它支持 Single、Cascade、Critique 三种执行模式,在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点且成本降低 67%。
推荐理由:原文给出了多模型编排的三种执行模式与基准测试结果,读者可据此判断它在质量与成本之间的取舍。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi 和 Hermes 等编码智能体提供本地持久记忆层。它从智能体已有会话日志构建索引,支持 recall 和 get 工具,默认本地运行,也可绑定到私有 Hugging Face 数据集跨机器共享。基准测试显示 recall 比手写交接便宜 8 倍和 4 倍。
推荐理由:原文给出了安装命令、跨智能体记忆机制和基准对比,读者可据此判断它能否解决自己切换智能体时丢失上下文的问题。
Google DeepMind 今日推出 Fairwind 计划,这是一个面向政府和受信任合作伙伴的有限访问项目,提供其最先进的网络防御能力。该计划首先让防御者使用 Gemini 3.8 Flash Cyber 模型和 CodeMender 工具,自主发现并修复漏洞,在组织安全云环境中几分钟内生成可部署的补丁。
推荐理由:原文给出了 Fairwind 计划的准入对象、能力组合和开放范围,读者可据此判断该计划对自身组织的适用性。
Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,可将 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。
推荐理由:官方给出了 token 与成本降幅和准确率提升的具体数字,读者可据此判断该功能对长视频分析的实际价值。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。
推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成式视频能力。
推荐理由:官方介绍了场景扩展、首尾帧控制、4K 放大等新能力,读者可据此判断它是否适合接入自己的视频生成工作流。
Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在加密环境中,防止模型提前看到测试题。该评测与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,用 Gemini Flash Lite 模型在隐私保护环境中测试机密基准,以提升评测完整性。
推荐理由:原文介绍了用加密环境做双盲评测的具体做法,读者可借此理解如何缓解基准污染、提升评测可信度。
Google DeepMind 发布 Gemini 3.5 Transcribe,这是其最精确的语音转文字模型,支持实时流式与预录音频处理,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。
推荐理由:原文给出了新模型的精度、延迟和开放入口,读者可以据此判断它相比 Chirp 3 的实际提升。
Mistral 发布 Agentic Search,一个多步骤检索层,让模型能搜索、导航、读取并验证复杂文档中的信息。在 FinanceBench 上,准确率从 26.7% 提升至 86%,OfficeQA Pro 上提升 45.6 个百分点;p90 延迟降低最多 39.6%,token 消耗减少三分之一。
推荐理由:官方给出了基准测试的准确率、延迟和 token 消耗数据,读者可据此判断 Agentic Search 相比传统 RAG 的实际收益。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。
Google DeepMind 今日启动 ATL Saathi 实时试点,这是一款基于 Gemini 的 Web 应用,为印度 Atal Tinkering Labs 的每位教育者提供 24/7 规划与培训助手,覆盖超 1.1 千万学生。