跳到正文

#推理

今日 1 条
3月17日周二
3月13日周五
12月3日周三
11月1日周六
  1. Berkeley AI Research62

    Transitive RL:基于分治范式的强化学习算法

    Seohong Park 在 Berkeley AI Research 博客介绍了一种基于分治范式的新型强化学习算法 Transitive RL(TRL),它不依赖时序差分(TD)学习,而是通过递归拆分轨迹来减少 Bellman 递归次数,从而更好地扩展到长程任务。

    推荐理由:原文提出一种不依赖时序差分学习的强化学习新范式,并给出在长程任务上的实验结果,读者可据此评估其可行性。

6月10日周二
5月7日周三
  1. Mistral AI74

    Mistral AI 发布 Mistral Medium 3,主打低成本高性能

    Mistral AI 发布 Mistral Medium 3,在多数基准上达到 Claude Sonnet 3.7 的 90% 以上性能,定价为每百万 token 输入 $0.4、输出 $2,成本显著更低。该模型在编码和 STEM 任务上接近更大规模的竞品,并支持混合部署或本地 VPC 部署,API 即日起在 Mistral La Plateforme 和 Amazon Sagemaker 上线。

    推荐理由:原文给出了性能对比和定价,读者可以据此判断中等规模模型在成本与能力之间的取舍。