Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数任务成本降低最多 30%,定价与 Sonnet 5 相同但基准测试全面胜出。该模型已用于 claude.ai 免费层,作者实测其生成 3D 鹈鹕骑自行车页面表现扎实,并指出其编码能力接近 Opus 5.5。Haiku 5.5 预计数周内推出。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。该模型面向聚焦编码和知识工作,多数任务成本更低、速度更快,能完成功能或缺陷修复并对照需求检查结果,生成的文档和图表也更精致。
推荐理由:原文给出了 Sonnet 5.5 的能力提升、适用场景和接入方式,读者可据此判断它适合哪些编码与知识工作负载。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。编码能力较前代大幅跃升,Terminal-Bench 4.0 得分从 10.3% 升至 70.6%,CursorBench 4.0 得分 55.5%,仅比 Opus 5.5 低约两分。
推荐理由:原文给出了 Sonnet 5.5 与 Opus 5.5 及前代的基准对比和定价,读者可据此判断中端模型的实际性价比。
Anthropic 发布其中端模型 Sonnet 5.5,称其比前代快 30%,token 消耗率显著降低,适合编码和办公文档等日常任务。Anthropic 的基准测试显示,Sonnet 5.5 在智能体编码上表现优于 Opus 5.5,且具备与 Opus 5 相当的网络安全能力,成为首个适用同等网络安全防护措施的 Sonnet 模型。公司还计划在未来几周发布最小模型 Haiku 的新版本。
Hugging Face 发布 Holo4 系列智能体模型,含 27B dense 和 35B-A3B MoE 两个尺寸,均已在 H Models API 上线,并同步开源 Holotron4 Nano。
推荐理由:原文给出了新模型的双尺寸、跨界面能力和开源轨迹数据,读者可据此评估它在真实业务工作流中的性价比。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
Anthropic 发布 Claude Opus 5.5,称多数任务性能接近 Fable 5.1,运行成本比 Opus 5 低 40%,速度提升约 30%,并成为 Claude Code 和 Claude 应用的默认模型。
推荐理由:原文梳理了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的定价、评测与安全争议,读者可据此对比两家实验室的竞争策略。
Anthropic 发布 Opus 5.5,声称相比 Opus 5 在默认设置下典型工作负载成本降低约 40%,因 token 价格下降且完成任务所需 token 更少,并在网络安全和生物学等高风险领域能力突出,相关请求可能被自动路由到旧模型。OpenAI 发布 GPT-6 Sol 和 Luna,作为 Astra 的迭代版本,部分基准测试中比前代能力提升几个百分点,但使用成本减半。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 上正式可用,两者 API 定价均显著低于 GPT-5.6 前代。
推荐理由:原文给出了两款模型的分工定位、降价幅度和提示词缓存能力,读者可据此判断如何按负载匹配模型。
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。相比 Opus 5,它用更少 token 完成任务,平均单任务成本更低,并首次配备生物、网络安全和 AI 开发领域的安全分类器。模型支持自适应思考,可通过 effort 控制推理量,适用于智能体编码和长文档知识工作。
推荐理由:原文给出了新模型的效率、定价与安全分类器变化,读者可据此评估其在长任务和智能体编码场景的适用性。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,Qwen3-VL 吞吐量比 GB300 NVL72 最高提升 3.7 倍,DeepSeek-R1 最高提升 2.5 倍。GB300 NVL72 在 288 GPU 规模下实现 99% 扩展效率,软件优化带来最高 1.6 倍性能提升。Nebius 等 19 家合作伙伴也提交了结果。
推荐理由:原文给出 Vera Rubin NVL72 在 MLPerf 推理基准上的首秀成绩与对比数据,读者可据此评估新一代平台的推理性能与扩展效率。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练而成,使用近三十年企业 CRM 部署数据的专有合成数据集。
推荐理由:原文给出了 Koa 的构建方式、性能数据和开放时间,读者可以据此判断它对企业 CRM 工作流的影响。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音对话模型,前者面向规模与成本效率,后者面向高复杂度任务。
推荐理由:官方给出了两个新模型的定位差异、基准成绩和开放渠道,读者可据此判断它们适合哪些语音智能体场景。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了分辨率、更新频率和降水精度等关键指标,读者可据此判断新一代天气模型的实际能力提升。
Hugging Face 发布 NeoMME,一个 260M 和 800M 的多语言多模态编码器家族,用单一双向 Transformer 同时处理文本 token 和原始图像块,从零训练,不使用预训练视觉塔或因果语言模型。
推荐理由:原文给出了模型架构、检索性能和压缩方案,读者可据此评估其在视觉文档检索中的适用性。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。
Google Research 发布 TimesFM-3,这是其时序基础模型家族的新一代版本,原生预训练用于多变量预测,参数量 3.3 亿,在超过 1 万亿时间点的真实与合成语料上完成预训练。
推荐理由:原文给出了模型架构、参数量、评测排名和开放入口,读者可据此判断它相对单变量模型的提升幅度。
微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数编码器压缩为 22M 参数的 ViT-S 骨干,在保持约 97% 预测性能的同时将全切片分析计算量降低约 50 倍,空间蛋白组学预测提速约 6 倍、显存减少约 8 倍。两模型均以 Apache 2.0 协议开放权重,代码与权重已上架 Hugging Face,面向科研用途而非临床诊疗。
推荐理由:原文给出了蒸馏压缩后的效率提升和开放权重入口,读者可据此评估病理基础模型在更大队列研究中的实用成本。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成式视频能力。
推荐理由:官方介绍了场景扩展、首尾帧控制、4K 放大等新能力,读者可据此判断它是否适合接入自己的视频生成工作流。
Google DeepMind 发布 Gemini 3.5 Transcribe,这是其最精确的语音转文字模型,支持实时流式与预录音频处理,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。
推荐理由:原文给出了新模型的精度、延迟和开放入口,读者可以据此判断它相比 Chirp 3 的实际提升。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,是面向编码和智能体场景的最强工作模型。
推荐理由:官方给出了编码、网页开发与知识工作场景的基准提升和半价定价,读者可据此评估升级价值。
Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中实现美国手语(ASL)到英语的听写。模型基于超过 10 万小时、50 多种手语数据训练,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩,并采用姿态关键点而非原始视频以保护隐私。
推荐理由:原文给出了 SL2T 的训练规模、基准成绩和落地入口,读者可据此判断手语 AI 从实验室走向消费产品的实际进展。
微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。
推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。