跳到正文

全部动态

今日 4 条
今天9月29日周二
  1. AWS Machine Learning Blog78

    Claude Sonnet 5.5 上线 Amazon Bedrock

    AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。该模型面向聚焦编码和知识工作,多数任务成本更低、速度更快,能完成功能或缺陷修复并对照需求检查结果,生成的文档和图表也更精致。

    推荐理由:原文给出了 Sonnet 5.5 的能力提升、适用场景和接入方式,读者可据此判断它适合哪些编码与知识工作负载。

  2. The Decoder78

    Anthropic 发布 Claude Sonnet 5.5,多项基准接近 Opus 5.5 且单任务成本低至三成

    Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。编码能力较前代大幅跃升,Terminal-Bench 4.0 得分从 10.3% 升至 70.6%,CursorBench 4.0 得分 55.5%,仅比 Opus 5.5 低约两分。

    推荐理由:原文给出了 Sonnet 5.5 与 Opus 5.5 及前代的基准对比和定价,读者可据此判断中端模型的实际性价比。

  3. TechCrunch · AI72

    Anthropic 发布 Sonnet 5.5,称其更便宜、更快的日常工作助手

    Anthropic 发布其中端模型 Sonnet 5.5,称其比前代快 30%,token 消耗率显著降低,适合编码和办公文档等日常任务。Anthropic 的基准测试显示,Sonnet 5.5 在智能体编码上表现优于 Opus 5.5,且具备与 Opus 5 相当的网络安全能力,成为首个适用同等网络安全防护措施的 Sonnet 模型。公司还计划在未来几周发布最小模型 Haiku 的新版本。

9月28日周一
9月24日周四
  1. Hugging Face Blog60

    Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,加速视觉语言模型推理

    Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。

    推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。

9月23日周三
  1. Latent Space85

    Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布,Anthropic 与 OpenAI 展开价格与能力竞争

    Anthropic 发布 Claude Opus 5.5,称多数任务性能接近 Fable 5.1,运行成本比 Opus 5 低 40%,速度提升约 30%,并成为 Claude Code 和 Claude 应用的默认模型。

    推荐理由:原文梳理了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的定价、评测与安全争议,读者可据此对比两家实验室的竞争策略。

  2. Ars Technica · AI67

    Anthropic 与 OpenAI 新模型主打更低价更高性价比

    Anthropic 发布 Opus 5.5,声称相比 Opus 5 在默认设置下典型工作负载成本降低约 40%,因 token 价格下降且完成任务所需 token 更少,并在网络安全和生物学等高风险领域能力突出,相关请求可能被自动路由到旧模型。OpenAI 发布 GPT-6 Sol 和 Luna,作为 Astra 的迭代版本,部分基准测试中比前代能力提升几个百分点,但使用成本减半。

9月16日周三
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。