跳到正文

全部动态

今日 6 条
9月8日周二
  1. Google DeepMind83

    Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组全部单核苷酸变异影响

    Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组中 90 亿个单核苷酸变异的分子效应预测,并推出 AVI 评分用于快速排序变异影响。该平台以 1PB 数据集形式提供,面向学术研究免费开放,可通过网站门户、AlphaGenome API 及 Google Antigravity 技能访问,商业用途即将在 Google Cloud 上线。

    推荐理由:原文给出了覆盖全基因组 90 亿单核苷酸变异的预测平台及其开放入口,读者可据此判断它在罕见病和复杂性状研究中的可用范围。

  2. Mistral AI62

    Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元

    Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超 210 亿欧元,为欧洲科技公司史上最大股权融资。三星电子领投,EQT 管理的 Scaleup Europe Fund 和现有投资者 PSG Equity 联合领投。资金将用于扩大前沿研究、算力、基础设施及国际业务,公司现覆盖 20 国,服务 Airbus、ASML、HSBC 等 125 余家企业的关键 AI 转型。

    推荐理由:原文给出了融资规模、估值和领投方,读者可以据此判断欧洲AI公司的资本格局与主权AI路线的市场认可度。

9月7日周一
9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML78

    GitHub 推出 Project HydraFusion 研究预览,通过多模型编排实现前沿质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型中选择执行计划,以平衡质量、成本与延迟。它支持 Single、Cascade、Critique 三种执行模式,在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点且成本降低 67%。

    推荐理由:原文给出了多模型编排的三种执行模式与基准测试结果,读者可据此判断它在质量与成本之间的取舍。

9月4日周五
  1. Google Research62

    Google 与 HHMI Janelia 发布完整雄性果蝇脑图谱

    Google Research 与 HHMI Janelia 等合作方在 Cell 发表论文,发布完整雄性果蝇脑与中枢神经系统连接组图谱,含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最大的脑图谱。该图谱经人工校验,可通过开源工具 Neuroglancer 查看和下载,并与雌性果蝇图谱互补,用于研究两性差异及个体间变异性。

    推荐理由:原文给出了迄今最大的脑图谱及其开放下载入口,读者可据此了解连接组学方法的最新进展。

  2. GitHub Blog · AI & ML38

    GitHub Copilot app 入门:如何同时运行多个智能体

    GitHub Copilot app 支持在同一项目上并行运行多个 AI 智能体会话,每个会话独立执行任务、互不干扰,并拥有各自的 Git worktree 和上下文,用户可随时切换且无需重新解释。通过 sessions view 可同时跟踪多个任务进度,例如在示例仓库 tailspin-toys 中并行实现 funded sort 功能、可访问性审查和测试运行,从而减少等待和上下文切换时间。

9月3日周四
  1. Hugging Face Blog62

    Hugging Face 发布多模态编码器 NeoMME,260M 与 800M 两档开源

    Hugging Face 发布 NeoMME,一个 260M 和 800M 的多语言多模态编码器家族,用单一双向 Transformer 同时处理文本 token 和原始图像块,从零训练,不使用预训练视觉塔或因果语言模型。

    推荐理由:原文给出了模型架构、检索性能和压缩方案,读者可据此评估其在视觉文档检索中的适用性。

  2. Hugging Face Blog82

    Hugging Face 发布 funes:为编码智能体提供本地持久记忆层

    Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi 和 Hermes 等编码智能体提供本地持久记忆层。它从智能体已有会话日志构建索引,支持 recall 和 get 工具,默认本地运行,也可绑定到私有 Hugging Face 数据集跨机器共享。基准测试显示 recall 比手写交接便宜 8 倍和 4 倍。

    推荐理由:原文给出了安装命令、跨智能体记忆机制和基准对比,读者可据此判断它能否解决自己切换智能体时丢失上下文的问题。

  3. Hugging Face Blog62

    用100步GRPO微调350M模型,IFStruct结构化输出从22.6%提升至29.7%

    Hugging Face 发布公开教程,用 TRL 库对 LFM2.5-350M 做约500样本、100步的 GRPO 微调,在 IFStruct 基准上从22.6%提升至29.7%,其中 JSON 通过率从18.0%升至31.9%。整套流程可在免费版 Colab 或 Kaggle GPU 上运行,评估可在 MacBook 上通过 llama.cpp 完成,代码已开源在 GitHub。

    推荐理由:给出了一套约500样本、100步的轻量GRPO微调配方,读者可据此低成本提升小模型的结构化输出合规率。

  4. Hugging Face Blog62

    用 TRL 和 OpenEnv 训练编码模型画水彩:完整开源复现

    作者用 TRL 和 OpenEnv 复现了 Surya Narreddi 的用语言模型写 JavaScript 画水彩的项目,并开源了参考数据集、RL 环境、训练脚本和训练好的模型。

    推荐理由:作者用 TRL 和 OpenEnv 完整复现了用代码画水彩的 RL 训练流程,并开源全部数据集、环境和模型,读者可据此复现或改造。

  5. Google DeepMind62

    Google DeepMind 推出 Fairwind 计划,向政府和合作伙伴开放高级网络防御能力

    Google DeepMind 今日推出 Fairwind 计划,这是一个面向政府和受信任合作伙伴的有限访问项目,提供其最先进的网络防御能力。该计划首先让防御者使用 Gemini 3.8 Flash Cyber 模型和 CodeMender 工具,自主发现并修复漏洞,在组织安全云环境中几分钟内生成可部署的补丁。

    推荐理由:原文给出了 Fairwind 计划的准入对象、能力组合和开放范围,读者可据此判断该计划对自身组织的适用性。

  6. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。

9月2日周三
  1. Hugging Face Blog42

    BenchMIRT:LLM 基准测试究竟在衡量什么?

    Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。

  2. Google Research62

    Google 与 NASA JPL 发布 MAPL-EMIT:用深度学习从太空绘制全球甲烷排放

    Google Research 与 NASA JPL 合作发表 PNAS 论文,提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 EMIT 高光谱数据,可同时完成甲烷羽流增强量化、羽流分割和源定位。

    推荐理由:原文给出了模型架构、训练方法和实测召回率,读者可据此评估这套深度学习方案在甲烷点源监测上的实际能力。

  3. Google DeepMind80

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,可将 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。

    推荐理由:官方给出了 token 与成本降幅和准确率提升的具体数字,读者可据此判断该功能对长视频分析的实际价值。

9月1日周二
  1. Hugging Face Blog73

    Hugging Face 发布 @huggingface/kernels:207 个 WebGPU 内核加速本地 AI 推理

    Hugging Face 发布 @huggingface/kernels,一个用于从 Hub 加载和运行优化 WebGPU 内核的库,并推出 207 个内核的初始集合,Apache-2.0 许可。在 Apple M4 GPU 上与 ORT WebGPU 对比,几何平均快 2.57 倍,中位数快 1.90 倍。同时推出 Fleet 浏览器基准测试套件,用于众包收集真实 GPU 上的正确性和性能证据。

    推荐理由:原文给出了 207 个 WebGPU 内核的发布、性能对比数据和开源许可,读者可据此评估浏览器端推理的加速空间。

  2. Google Research65

    Google 发布 TimesFM-3 多变量时序预测基础模型

    Google Research 发布 TimesFM-3,这是其时序基础模型家族的新一代版本,原生预训练用于多变量预测,参数量 3.3 亿,在超过 1 万亿时间点的真实与合成语料上完成预训练。

    推荐理由:原文给出了模型架构、参数量、评测排名和开放入口,读者可据此判断它相对单变量模型的提升幅度。

  3. Microsoft Research62

    微软发布 GigaPath-Flash 与 GigaTIME-Flash 高效病理基础模型

    微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数编码器压缩为 22M 参数的 ViT-S 骨干,在保持约 97% 预测性能的同时将全切片分析计算量降低约 50 倍,空间蛋白组学预测提速约 6 倍、显存减少约 8 倍。两模型均以 Apache 2.0 协议开放权重,代码与权重已上架 Hugging Face,面向科研用途而非临床诊疗。

    推荐理由:原文给出了蒸馏压缩后的效率提升和开放权重入口,读者可据此评估病理基础模型在更大队列研究中的实用成本。

8月28日周五
  1. Hugging Face Blog69

    Open ASR Leaderboard 新增首个全球南方语言印地语评测集

    Hugging Face 与 Voice Arena 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测集 Monsoon,这是该榜单多语言标签页首次覆盖印度语言。四个子集共 4,888 位说话人,记录 12 项说话人属性,并采用私有分割防止针对榜单的优化。印地语集因拼写变体众多改用 OIWER 指标,并开源实现 voi-oiwer 以便复现。

    推荐理由:原文展示了区域、设备等元数据如何暴露榜单上被平均掩盖的模型差异,读者可据此理解评测设计对模型选型的影响。

  2. Google Research62

    Google Earth AI 推出行星预测引擎 PPE,自主完成地理空间建模全流程

    Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。

    推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。

8月27日周四
  1. Google DeepMind62

    Google DeepMind 试点全球首个双盲 AI 评测

    Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在加密环境中,防止模型提前看到测试题。该评测与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,用 Gemini Flash Lite 模型在隐私保护环境中测试机密基准,以提升评测完整性。

    推荐理由:原文介绍了用加密环境做双盲评测的具体做法,读者可借此理解如何缓解基准污染、提升评测可信度。

  2. Google Research45

    GlucoFM:面向连续血糖监测的双流基础模型

    Google Research 推出 GlucoFM,一种面向连续血糖监测(CGM)的自监督基础模型,采用双流设计分离缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,GlucoFM 的平均 PR-AUC 比最优 GluFormer 变体高 5.8 个百分点,并在所有糖尿病风险和 β 细胞功能障碍评估中领先。

8月26日周三