跳到正文

#编码

今日 1 条
今天9月29日周二
  1. The Decoder78

    Anthropic 发布 Claude Sonnet 5.5,多项基准接近 Opus 5.5 且单任务成本低至三成

    Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。编码能力较前代大幅跃升,Terminal-Bench 4.0 得分从 10.3% 升至 70.6%,CursorBench 4.0 得分 55.5%,仅比 Opus 5.5 低约两分。

    推荐理由:原文给出了 Sonnet 5.5 与 Opus 5.5 及前代的基准对比和定价,读者可据此判断中端模型的实际性价比。

9月28日周一
  1. Simon Willison77

    Simon Willison 年度演讲:2026年AI行业全景回顾

    Simon Willison 在 WeAreDevelopers 大会闭幕演讲中回顾了2026年AI行业的关键趋势。年初 Claude Opus 4.5 和 GPT-5.1 让编码智能体变得可靠,随后 OpenClaw 掀起个人智能体热潮,开源模型如 Qwen 3.8 27B 已能在笔记本上接近前沿水平。

    推荐理由:作者以亲历者视角梳理2026年AI行业关键趋势,从编码智能体成熟到开源模型崛起,适合快速把握一年脉络。

9月27日周日
9月26日周六
9月24日周四
  1. AWS Machine Learning Blog62

    AWS 教程:用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体

    AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。

    推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。

9月18日周五
9月11日周五
  1. GitHub Blog · AI & ML43

    GitHub Copilot app 入门:用 diff、终端和浏览器面板审查 AI 代码

    GitHub Copilot app 新增内置 diff、终端和浏览器面板,让用户无需离开应用即可审查、运行并预览智能体对代码的改动。diff 面板以红绿高亮显示增删行,支持接受或评论;终端面板可直接运行项目命令,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成审查后可直接在应用内接受改动并创建 pull request。

9月9日周三
  1. Mistral AI62

    Mistral 用 AI 智能体将 4 万行 Fortran 77 迁移到 C++ 的实践

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 物理模拟器迁移到 C++,并总结了可复用的方法。项目先构建数值一致性校验框架,再用 Vibe CLI 生成调用树并派上百个智能体整理文档,最后采用人工把关的规划、编码、测试、审查智能体工作流逐模块迁移。

    推荐理由:原文给出了用智能体迁移遗留代码的完整工作流和三条可复用原则,读者可直接借鉴到同类项目。

9月5日周六
  1. GitHub Blog · AI & ML78

    GitHub 推出 Project HydraFusion 研究预览,通过多模型编排实现前沿质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型中选择执行计划,以平衡质量、成本与延迟。它支持 Single、Cascade、Critique 三种执行模式,在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点且成本降低 67%。

    推荐理由:原文给出了多模型编排的三种执行模式与基准测试结果,读者可据此判断它在质量与成本之间的取舍。

9月4日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot app 入门:如何同时运行多个智能体

    GitHub Copilot app 支持在同一项目上并行运行多个 AI 智能体会话,每个会话独立执行任务、互不干扰,并拥有各自的 Git worktree 和上下文,用户可随时切换且无需重新解释。通过 sessions view 可同时跟踪多个任务进度,例如在示例仓库 tailspin-toys 中并行实现 funded sort 功能、可访问性审查和测试运行,从而减少等待和上下文切换时间。

9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。

8月14日周五
8月4日周二
  1. Microsoft Research80

    微软开源 Orchard 智能体训练框架,Orchard-SWE 在 SWE-bench Verified 达 69.7%

    微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。

    推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。