AWS 发布基于 Strands Agents SDK 的智能体视频问答架构
AWS 官方博客发布了一套基于 Strands Agents SDK、Amazon Bedrock、Rekognition 和 Transcribe 的智能体视频问答方案,用户可用自然语言查询视频内容。
AWS 官方博客发布了一套基于 Strands Agents SDK、Amazon Bedrock、Rekognition 和 Transcribe 的智能体视频问答方案,用户可用自然语言查询视频内容。
AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。
推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
LibreChat v0.8.8-rc4 发布,新增 GPT-6 Sol、GPT-6 Luna 和 Claude Opus 5.5 支持,并引入 Open Responses API 的调用方执行工具。
NVIDIA AI Day Singapore 于 9 月 22-23 日在新加坡莱佛士城会议中心举行,NVIDIA 与合作伙伴展示东南亚地区的 AI 突破。
GPT-6 改进了提示词缓存机制,实现更高的缓存命中率,并新增诊断工具、显式断点及控制选项,以降低延迟和成本。这些功能旨在帮助开发者更高效地管理缓存行为,优化 API 调用性能。
Simon Willison 发布 llm 0.36 版本。该版本更新内容未在原文中详细说明,仅提及这是其月度简报的一部分,简报每月汇总最重要的 LLM 发展动态,赞助费用为 $10/month。
行云科技与某国资供应商签署3份《算力服务合同》,购买GPU算力服务合计43套,服务期限均为5年,含税总金额45,313.98万元,系此前128套框架性采购协议项下进展。合同约定5年期满后双方续约3年,续约期间净利润70%归公司、30%为供应商服务费。公司提示供货交付延期、算力贬值及高额违约赔付等风险。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速开源包,新增智能体工作流和平台支持,帮助开发者更快构建、定制和部署机器人应用。
推荐理由:原文给出了 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持和生态伙伴落地案例,读者可据此判断它如何加速机器人开发。
LibreChat 发布 chart-2.0.13 版本,要求使用命名 Helm 凭据密钥,并更新文档以阐明 Helm 凭据注入和 Meilisearch 密钥的相关说明。
Hugging Face 在 transformers 中加入对 GGUF 模型的高效运行支持,通过复用 ggml 的 Metal 内核,可在 Apple Silicon 上以熟悉的 from_pretrained 接口加载并生成。
推荐理由:原文给出了 GGUF 加载方式、性能对比和当前限制,读者可以据此判断在 transformers 里跑本地量化模型的可行性与适用场景。
Cloudflare 宣布 Python Workers 正式全面可用,Python 成为其开发者平台的一等支持语言。该实现通过 Pyodide 将 Python 编译为 WebAssembly 在基于 V8 的 workerd 运行时中运行,但多进程和多线程在 WebAssembly 虚拟机中不可用。
NVIDIA 推出 DSX Ready 认证计划,用于对符合 NVIDIA DSX AI 工厂参考设计要求的合作伙伴产品进行资格认证。计划启动时包含电池储能系统(BESS)和冷却分配单元(CDU)两个类别,首批合格厂商包括 Hitachi Energy、LG Energy Solution、Tesla 以及 LG Electronics、LiquidStack、Vertiv。
埃及AI生态正从潜力走向规模化生产,NVIDIA在开罗举办活动展示其全栈AI方案。过去一年,NVIDIA深度学习学院在埃及的学习者数量增长超十倍;Hassan Allam Data Centers获许可建设数据中心,预计投资4亿美元。非洲一年内新增四座AI工厂,另有656兆瓦容量在建,Cassava Technologies等企业正推动本地化AI基础设施部署。
new-api v1.0.0-rc.40 发布,将任务插件源码上传上限提高到 8 MiB,并接受上游 201/202 等 2xx 状态码,避免任务被误判失败。该版本还修复了定价配置在插件收窄选项后仍可编辑、Claude/Responses 工具结果图片按图片而非文本发送等问题。
relaykit v0.2.1 发布,本次更新包含一个针对 Claude tool_result 的修复,并感谢了 #7444 的作者。该提交已通过验证签名,附带 2 个资源文件。
NVIDIA 提出 AI 安全本质是工程问题,需在智能体栈的每一层(模型、工具、运行时环境)落实可执行的安全边界、责任人与防护证据。NVIDIA 开源 OpenShell 安全运行时,在智能体触及范围之外强制策略并提供沙箱执行;Cisco DefenseClaw、JFrog 等合作伙伴正基于 OpenShell 构建治理与技能扫描层。
NVIDIA 在纽约气候周上展示了五家将 AI 融入清洁能源项目的公司。ThinkLabs AI 利用数字孪生和智能体,将电网互联申请评估时间从 30-45 天缩短至两分钟。
Hugging Face 发布 tokenizers v1 的候选版本,编码路径比 v0.23 快 3 到 30 倍,在 Apple M4 Max 上八线程扩展效率为线性扩展的 76%,且输出 token ID 与旧版完全一致。
推荐理由:原文给出了 v1 相比 v0.23 的编码提速幅度和实现原理,读者可据此判断升级收益与适用场景。
new-api v1.0.0-rc.39 发布,任务插件现已兼容 OpenAI Images,可承接 `/v1/images/generations` 和 `/v1/images/edits` 请求。阿里云百炼万相图片模型改走任务插件,豆包 Seedream 图片生成已接入。额度设置新增钱包免预扣门槛和输入预扣倍率,余额足够时可跳过预扣。
new-api v1.0.0-rc.38 发布,系统设置新增请求策略,可集中配置请求检查、会话与重试、渠道健康,并在使用日志中记录策略决策。渠道新增 vLLM、SGLang 支持,并可按渠道开启 Responses WebSocket 与 OpenAI 兼容对话。该版本仍不推荐用于生产环境,从 v1.0.0-rc.26 或更早版本升级的用户需重新配置所有视频模型价格。
Pawprint Studio 的开放世界抓宠 RPG《Aniimo》本周登陆 GeForce NOW,玩家无需等待 45GB 下载即可在 Steam Deck、Firefox 浏览器等设备上串流游玩。
GitHub 用 Copilot 将 Copilot 运行时从 TypeScript 重写为超过 80 万行生产 Rust,历时约 14.5 周,由一名开发者主导完成。重写采用组件级就地替换策略,性能提升数个数量级,并新增 C ABI 支持进程内嵌入。
推荐理由:原文给出了用 Copilot 自身完成大规模 Rust 重写的完整过程与数据,读者可据此评估 AI 辅助重写的可行性与工程方法。
康惠股份全资子公司北京康惠智创与A公司签署五年期算力服务合同,总金额约17.20亿元(含税),并为此向供应商G公司采购高性能算力服务器,合同金额约11.41亿元(含税)。公司预计需投入约11.41亿元购置服务器,主要依靠金融机构融资,资产负债率预计将由69%上升至78%左右。算力交付自2026年三季度末至2027年一季度末分批实施,预计2026年度新增收入约3,000万元。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,Qwen3-VL 吞吐量比 GB300 NVL72 最高提升 3.7 倍,DeepSeek-R1 最高提升 2.5 倍。GB300 NVL72 在 288 GPU 规模下实现 99% 扩展效率,软件优化带来最高 1.6 倍性能提升。Nebius 等 19 家合作伙伴也提交了结果。
推荐理由:原文给出 Vera Rubin NVL72 在 MLPerf 推理基准上的首秀成绩与对比数据,读者可据此评估新一代平台的推理性能与扩展效率。
OpenAI 介绍 ChatGPT Work 与 Codex 的分析功能,帮助团队了解 AI 使用情况与支出、识别培训需求,并将采用情况与业务成果关联起来。该功能旨在让企业量化 AI 投入的实际回报,从而更精准地优化部署策略。
NVIDIA 在 AI Infra Summit 上介绍 DSX 平台,用于在固定功率预算内最大化 AI 工厂的 token 吞吐。云服务商 Lambda 的首次验证显示,19 个节点在 85% 功率下比 16 个节点满功率多产出 24% 的集群 token 吞吐,性能每瓦提升 23%。
推荐理由:原文给出 DSX 平台在功率管理上的实测数据与首个商业部署,读者可据此评估 AI 工厂在固定功率预算下的提效空间。
NVIDIA 在 AI Infra Summit 上宣布 Vera Rubin 与 DSX 平台多项进展,包括与 Amazon Annapurna Labs 合作 NVHBM 技术、d-Matrix 集成 NVLink Fusion,以及 Emerald AI 与 Silicon Valley Power 的灵活负载项目。
推荐理由:原文汇总了 NVIDIA 在 AI Infra Summit 上围绕 Vera Rubin 与 DSX 平台的多项进展,读者可据此了解 AI 工厂在能效与吞吐上的最新优化方向。
LibreChat v0.8.8-rc3 发布,重点推出实验性的 Bring-Your-Own-Machine(BYOM)功能,用于可扩展编码智能体,并新增 GPT-6 Astra 支持、Agent/Skills CRUD API 改进、Conversation Trace Viewer 及子智能体文件共享。
LibreChat 发布 Helm chart 2.0.12,本次更新为常规版本号递增(chore),无功能变更说明。该版本已通过 GitHub 验证签名,可用于部署或升级 LibreChat 应用。
Perplexity 已采用 GPT-6 Astra 处理通信撰写、软件变更及生产系统监控等端到端任务。相比早期模型,Perplexity 对 Astra 的检查频率大幅降低,表明其对该模型的自主能力信任度显著提升。
new-api v1.0.0-rc.37 推出定价配置功能,可将旧定价转为计费表达式草稿,并支持按条件、按次、按时间及图片用量/缓存计价,为 gpt-image-2、gpt-image-2.5-sunburst、gpt-image-2.5-flare 提供内置计费表达式默认值。
OpenAI 将存储系统 Habitat 从 Python 库演进为全球分布式平台,支撑 ChatGPT 超 10 亿用户与每秒 2200 万次请求。该平台面向大规模在线存储场景设计,是 OpenAI 基础设施扩展的关键一环。
Cloudera 与 Mistral 宣布建立新合作伙伴关系,将 Mistral 模型集成到 Cloudera 的混合数据平台中,使企业能够在私有云、公共云、本地及完全隔离(air-gapped)环境中部署 AI 模型并保持完全控制。企业还可利用专有数据在受控环境中训练定制模型,保留数据和智能的所有权。该合作旨在满足对主权 AI 日益增长的需求,让数据、智能、计算和运营始终处于客户控制之下。
Dify v1.17.1 发布,知识库服务 API 密钥现可绑定至特定数据集,越权访问返回 403,现有密钥保持工作区级行为不变。工作流画布节点与评论支持键盘移动,插件作者获得公开主页,Markdown 表单字段名长度上限可通过环境变量配置。自托管用户需注意:内置 Weaviate 须从 1.27.0 手动分阶段升级至 1.39.2,跳过中间版本可能导致向量搜索永久损坏。
Hugging Face 博客介绍如何用 AsyncGRPOTrainer 结合 LoRA 在 HF Jobs 上跨节点训练,通过 Storage Bucket 同步适配器而非 NCCL,并用代理路由请求。500 步训练从 3 小时 27 分钟优化到 53 分钟,速度提升 3.9 倍,代码已开源。
推荐理由:原文给出了完整的架构、代码和调优过程,读者可以据此复现跨节点 LoRA 异步强化学习训练。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了分辨率、更新频率和降水精度等关键指标,读者可据此判断新一代天气模型的实际能力提升。
Dify v1.16.1 发布,主要包含 Bug 修复与安全增强。新增工具多选输入、工作流节点定位、侧边栏导出 Agent DSL 等功能。安全方面,Agent 沙箱现通过 Squid 正向代理运行并采用令牌认证,同时修复了 Jinja2 模板注入漏洞。性能上,新增轻量级 recent apps 端点,使首页“继续工作”区域延迟降低约 69%(3.2 倍提速)。
Dify 1.17.0 发布,Agent 新增 E2B 云沙箱后端、构建时 Home 快照和 workspace 级技能管理,并支持上下文感知的历史压缩。工作流新增可复用 LLM 环境变量与循环内人工输入,同时引入统一追踪、Turnstile 验证和 Azure Key Vault 支持。
Hugging Face 发布 @huggingface/kernels,一个用于从 Hub 加载和运行优化 WebGPU 内核的库,并推出 207 个内核的初始集合,Apache-2.0 许可。在 Apple M4 GPU 上与 ORT WebGPU 对比,几何平均快 2.57 倍,中位数快 1.90 倍。同时推出 Fleet 浏览器基准测试套件,用于众包收集真实 GPU 上的正确性和性能证据。
推荐理由:原文给出了 207 个 WebGPU 内核的发布、性能对比数据和开源许可,读者可据此评估浏览器端推理的加速空间。