跳到正文

#安全/对齐

今日 0 条
9月23日周三
  1. AWS Machine Learning Blog80

    Claude Opus 5.5 在 AWS 上线

    Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。相比 Opus 5,它用更少 token 完成任务,平均单任务成本更低,并首次配备生物、网络安全和 AI 开发领域的安全分类器。模型支持自适应思考,可通过 effort 控制推理量,适用于智能体编码和长文档知识工作。

    推荐理由:原文给出了新模型的效率、定价与安全分类器变化,读者可据此评估其在长任务和智能体编码场景的适用性。

9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。

8月4日周二
  1. Mistral AI70

    Mistral 发布 3B 开源多模态安全审核模型 Shieldstral

    Mistral 发布 Shieldstral,一个 3B 开源多模态安全审核模型,在文本安全上匹配最高 7 倍规模的模型,并在多模态审核上达到新 SOTA。它把内容审核建模为策略自适应问答,推理时用自然语言问题定义策略,无需重训即可统一审核文本和图像,返回校准的安全分数。模型以 Apache 2.0 开源,可在单张 16GB NVIDIA GPU 上运行。

    推荐理由:原文给出了把内容审核建模为策略自适应问答的思路,读者可以据此判断这种免重训的审核方式是否适合自身场景。

7月17日周五