跳到正文

#评测/基准

今日 0 条
9月23日周三
9月22日周二
9月16日周三
9月2日周三
  1. Hugging Face Blog42

    BenchMIRT:LLM 基准测试究竟在衡量什么?

    Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。

8月28日周五
  1. Hugging Face Blog69

    Open ASR Leaderboard 新增首个全球南方语言印地语评测集

    Hugging Face 与 Voice Arena 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测集 Monsoon,这是该榜单多语言标签页首次覆盖印度语言。四个子集共 4,888 位说话人,记录 12 项说话人属性,并采用私有分割防止针对榜单的优化。印地语集因拼写变体众多改用 OIWER 指标,并开源实现 voi-oiwer 以便复现。

    推荐理由:原文展示了区域、设备等元数据如何暴露榜单上被平均掩盖的模型差异,读者可据此理解评测设计对模型选型的影响。

8月27日周四
  1. Google DeepMind62

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在加密环境中,防止模型提前看到测试题。该评测与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,用 Gemini Flash Lite 模型在隐私保护环境中测试机密基准,以提升评测完整性。

    推荐理由:原文介绍了用加密环境做双盲评测的具体做法,读者可借此理解如何缓解基准污染、提升评测可信度。

8月21日周五
  1. Hugging Face Blog80

    Hugging Face 研究:语音识别模型存在基准拟合现象,高分模型复现错误转录

    Hugging Face 发布研究,提出三项测试量化语音识别中的基准优化现象,评估 11 个开源 ASR 模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 基准中的错误转录,即使音频与之矛盾或数字被静音。

    推荐理由:原文用三项探针量化了语音识别模型对公开基准的拟合程度,并给出可复现的检测脚本,读者可据此判断模型真实泛化能力。

8月13日周四
7月15日周三
  1. Hugging Face Blog62

    Hugging Face 推出 Real World VoiceEQ 语音 AI 评测基准

    Hugging Face 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多个主流开源与专有语音模型、15 项以上评测维度和 60 多项指标,基于超过 100 万条人工评分构建。评测发现语音模型在听与说能力上分化明显,传统基准可能高估真实表现,且语音语言模型尚不能完全替代人工评测。

    推荐理由:原文给出了新基准的规模、维度与关键发现,读者可据此判断现有语音模型评测的盲区。

7月1日周三
  1. Hugging Face Blog62

    IBM 发布 ScarfBench,用于评测 AI 智能体的企业 Java 框架迁移能力

    IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。

    推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。

6月30日周二
4月9日周四
4月9日周三
  1. Mistral AI38

    Mistral 评估 RAG 系统:以 LLM 为裁判与 RAG Triad 框架

    Mistral 探讨如何用“LLM As A Judge”方法评估 RAG 系统,通过裁判模型按数值、二元或定性量表为生成答案打分。文章介绍了 RAG Triad 框架,从上下文相关性、接地性和答案相关性三个维度检查检索与生成质量。Mistral 的模型可同时充当生成器和裁判,其 API 的结构化输出功能可用于构建更可靠的评估流程。