跳到正文

#Hugging Face

今日 0 条
9月16日周三
9月3日周四
  1. Hugging Face Blog62

    Hugging Face 发布多模态编码器 NeoMME,260M 与 800M 两档开源

    Hugging Face 发布 NeoMME,一个 260M 和 800M 的多语言多模态编码器家族,用单一双向 Transformer 同时处理文本 token 和原始图像块,从零训练,不使用预训练视觉塔或因果语言模型。

    推荐理由:原文给出了模型架构、检索性能和压缩方案,读者可据此评估其在视觉文档检索中的适用性。

9月1日周二
  1. Microsoft Research62

    微软发布 GigaPath-Flash 与 GigaTIME-Flash 高效病理基础模型

    微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数编码器压缩为 22M 参数的 ViT-S 骨干,在保持约 97% 预测性能的同时将全切片分析计算量降低约 50 倍,空间蛋白组学预测提速约 6 倍、显存减少约 8 倍。两模型均以 Apache 2.0 协议开放权重,代码与权重已上架 Hugging Face,面向科研用途而非临床诊疗。

    推荐理由:原文给出了蒸馏压缩后的效率提升和开放权重入口,读者可据此评估病理基础模型在更大队列研究中的实用成本。

8月25日周二
  1. Hugging Face Blog62

    Quantization-Aware Healing 论文:4-bit 压缩模型在 7/9 基准上超越其全精度原版

    Multiverse Computing 发布论文《Quantization-Aware Healing》,提出从压缩前原模型直接蒸馏的修复方法,应用于 GPT-OSS 120B 压缩至 60B 并量化到 MXFP4 后,在 7/9 基准上超越其 bfloat16 版本,其中长上下文推理 +7.4、数学 +5.6。

    推荐理由:论文提出从压缩前原模型蒸馏的修复方法,让 4-bit 模型在多数基准上反超自身 bfloat16 版本,并对比了与 QAT 的稳定性差异。

8月21日周五
  1. Hugging Face Blog80

    Hugging Face 研究:语音识别模型存在基准拟合现象,高分模型复现错误转录

    Hugging Face 发布研究,提出三项测试量化语音识别中的基准优化现象,评估 11 个开源 ASR 模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 基准中的错误转录,即使音频与之矛盾或数字被静音。

    推荐理由:原文用三项探针量化了语音识别模型对公开基准的拟合程度,并给出可复现的检测脚本,读者可据此判断模型真实泛化能力。

8月19日周三
  1. Hugging Face Blog62

    IBM 研究:智能体记忆剂量需按模型能力校准,而非简单累积

    IBM 研究团队发布 ALTK-Evolve 相关研究,探讨智能体需要多少记忆。在八款模型上的 AppWorld 评测显示,强模型适合完整指南集,弱模型适合精简核心加按任务检索,饱和模型无增益。gpt-oss-120b 用精选检索在仅增加 5% token 时提升 16.1 个百分点任务完成率,提示缓存可降低生产环境成本。

    推荐理由:原文用八模型实测说明智能体记忆并非越多越好,剂量需按模型能力校准,并给出成本数据。

8月11日周二
8月10日周一
  1. Hugging Face Blog62

    Multiverse Computing 提出高效知识蒸馏方法,将长上下文蒸馏压缩到单 GPU 可运行

    Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 和融合分块 KL 损失,避免同时加载教师与学生模型,也无需物化完整的词表×序列长度矩阵。

    推荐理由:原文给出了离线蒸馏和融合分块 KL 损失的实现与内存对比,读者可据此评估在单卡上做长上下文蒸馏的可行性。

7月15日周三
  1. Hugging Face Blog62

    Hugging Face 推出 Real World VoiceEQ 语音 AI 评测基准

    Hugging Face 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多个主流开源与专有语音模型、15 项以上评测维度和 60 多项指标,基于超过 100 万条人工评分构建。评测发现语音模型在听与说能力上分化明显,传统基准可能高估真实表现,且语音语言模型尚不能完全替代人工评测。

    推荐理由:原文给出了新基准的规模、维度与关键发现,读者可据此判断现有语音模型评测的盲区。