Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
NVIDIA 发布教程,讲解如何用 NVIDIA Warp 与 MuJoCo Warp(MJWarp)将 SO-101 机械臂场景从单世界 CPU 仿真迁移到最多 2048 个并行 GPU 环境。文章覆盖单世界校验、批量分配、容量调优与吞吐测量,并给出 pip install warp-lang 与 mujoco-warp 的安装入口。
推荐理由:原文给出从单世界 MuJoCo 迁移到 2048 并行 MJWarp 环境的完整步骤,读者可直接照做并复现吞吐测量。
GitHub Copilot 应用重构了 Pull Request 视图,以应对 2200 个文件、超百万行改动和 400 多条评论的极端场景。方案将文档高度拆分为确定性代码高度与动态块高度两个独立域,用单次空闲与滚动门控的测量通道替代逐块 ResizeObserver,并通过按身份而非像素的滚动锚定避免跳动。团队还构建了自主的变更、测量、改进循环,用真实信号自动定位性能问题。
推荐理由:原文拆解了超大 diff 渲染的虚拟化、测量调度与滚动锚定方案,读者可借鉴其工程取舍。
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
NVIDIA 在 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速开源包,新增智能体工作流和平台支持,帮助开发者更快构建、定制和部署机器人应用。
推荐理由:原文给出了 Isaac ROS 5.0 的智能体工作流、ROS Lyrical 支持和生态伙伴落地案例,读者可据此判断它如何加速机器人开发。
Hugging Face 在 transformers 中加入对 GGUF 模型的高效运行支持,通过复用 ggml 的 Metal 内核,可在 Apple Silicon 上以熟悉的 from_pretrained 接口加载并生成。
推荐理由:原文给出了 GGUF 加载方式、性能对比和当前限制,读者可以据此判断在 transformers 里跑本地量化模型的可行性与适用场景。
Hugging Face 发布 tokenizers v1 的候选版本,编码路径比 v0.23 快 3 到 30 倍,在 Apple M4 Max 上八线程扩展效率为线性扩展的 76%,且输出 token ID 与旧版完全一致。
推荐理由:原文给出了 v1 相比 v0.23 的编码提速幅度和实现原理,读者可据此判断升级收益与适用场景。
GitHub 用 Copilot 将 Copilot 运行时从 TypeScript 重写为超过 80 万行生产 Rust,历时约 14.5 周,由一名开发者主导完成。重写采用组件级就地替换策略,性能提升数个数量级,并新增 C ABI 支持进程内嵌入。
推荐理由:原文给出了用 Copilot 自身完成大规模 Rust 重写的完整过程与数据,读者可据此评估 AI 辅助重写的可行性与工程方法。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了分辨率、更新频率和降水精度等关键指标,读者可据此判断新一代天气模型的实际能力提升。
Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。
推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。
Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。
推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。