Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 且成本降低
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数任务成本降低最多 30%,定价与 Sonnet 5 相同但基准测试全面胜出。该模型已用于 claude.ai 免费层,作者实测其生成 3D 鹈鹕骑自行车页面表现扎实,并指出其编码能力接近 Opus 5.5。Haiku 5.5 预计数周内推出。
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数任务成本降低最多 30%,定价与 Sonnet 5 相同但基准测试全面胜出。该模型已用于 claude.ai 免费层,作者实测其生成 3D 鹈鹕骑自行车页面表现扎实,并指出其编码能力接近 Opus 5.5。Haiku 5.5 预计数周内推出。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。该模型面向聚焦编码和知识工作,多数任务成本更低、速度更快,能完成功能或缺陷修复并对照需求检查结果,生成的文档和图表也更精致。
推荐理由:原文给出了 Sonnet 5.5 的能力提升、适用场景和接入方式,读者可据此判断它适合哪些编码与知识工作负载。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。编码能力较前代大幅跃升,Terminal-Bench 4.0 得分从 10.3% 升至 70.6%,CursorBench 4.0 得分 55.5%,仅比 Opus 5.5 低约两分。
推荐理由:原文给出了 Sonnet 5.5 与 Opus 5.5 及前代的基准对比和定价,读者可据此判断中端模型的实际性价比。
Anthropic 发布其中端模型 Sonnet 5.5,称其比前代快 30%,token 消耗率显著降低,适合编码和办公文档等日常任务。Anthropic 的基准测试显示,Sonnet 5.5 在智能体编码上表现优于 Opus 5.5,且具备与 Opus 5 相当的网络安全能力,成为首个适用同等网络安全防护措施的 Sonnet 模型。公司还计划在未来几周发布最小模型 Haiku 的新版本。
Hugging Face 发布 Holo4 系列智能体模型,含 27B dense 和 35B-A3B MoE 两个尺寸,均已在 H Models API 上线,并同步开源 Holotron4 Nano。
推荐理由:原文给出了新模型的双尺寸、跨界面能力和开源轨迹数据,读者可据此评估它在真实业务工作流中的性价比。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
Anthropic 发布 Claude Opus 5.5,称多数任务性能接近 Fable 5.1,运行成本比 Opus 5 低 40%,速度提升约 30%,并成为 Claude Code 和 Claude 应用的默认模型。
推荐理由:原文梳理了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的定价、评测与安全争议,读者可据此对比两家实验室的竞争策略。
Anthropic 发布 Opus 5.5,声称相比 Opus 5 在默认设置下典型工作负载成本降低约 40%,因 token 价格下降且完成任务所需 token 更少,并在网络安全和生物学等高风险领域能力突出,相关请求可能被自动路由到旧模型。OpenAI 发布 GPT-6 Sol 和 Luna,作为 Astra 的迭代版本,部分基准测试中比前代能力提升几个百分点,但使用成本减半。
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。相比 Opus 5,它用更少 token 完成任务,平均单任务成本更低,并首次配备生物、网络安全和 AI 开发领域的安全分类器。模型支持自适应思考,可通过 effort 控制推理量,适用于智能体编码和长文档知识工作。
推荐理由:原文给出了新模型的效率、定价与安全分类器变化,读者可据此评估其在长任务和智能体编码场景的适用性。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音对话模型,前者面向规模与成本效率,后者面向高复杂度任务。
推荐理由:官方给出了两个新模型的定位差异、基准成绩和开放渠道,读者可据此判断它们适合哪些语音智能体场景。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了分辨率、更新频率和降水精度等关键指标,读者可据此判断新一代天气模型的实际能力提升。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。
Google Research 发布 TimesFM-3,这是其时序基础模型家族的新一代版本,原生预训练用于多变量预测,参数量 3.3 亿,在超过 1 万亿时间点的真实与合成语料上完成预训练。
推荐理由:原文给出了模型架构、参数量、评测排名和开放入口,读者可据此判断它相对单变量模型的提升幅度。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,是面向编码和智能体场景的最强工作模型。
推荐理由:官方给出了编码、网页开发与知识工作场景的基准提升和半价定价,读者可据此评估升级价值。
Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中实现美国手语(ASL)到英语的听写。模型基于超过 10 万小时、50 多种手语数据训练,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩,并采用姿态关键点而非原始视频以保护隐私。
推荐理由:原文给出了 SL2T 的训练规模、基准成绩和落地入口,读者可据此判断手语 AI 从实验室走向消费产品的实际进展。