Proaction 借助 Codex、GPT-Live-1 与 GPT-6 Astra 实现销售额提升 60%、节省 75 多小时
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理方案,销售额提升 60%,节省 75 多小时。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理方案,销售额提升 60%,节省 75 多小时。
AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。
推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。
Airbnb 正扩大对 GPT-6 Astra 及 OpenAI 前沿模型的访问权限,帮助工程团队解决 bug、设计系统并加快交付速度。此举旨在让更多内部团队直接调用这些模型,提升开发效率与产品迭代节奏。
GitHub Podcast 最新一期拆解五大 AI 热论:AI 生成代码仍需人工审查、不会用 AI 未必影响求职、Skills 与 MCP 解决不同问题、RAG 未死、代码库难懂或反映可维护性问题。节目主张用提问代替站队,在真实工作中检验观点。
GPT-6 Astra 提升了 Devin 的软件测试与验证能力,目标是让工程师减少代码审查工作量、加快交付速度。
GitHub Copilot app 新增内置 diff、终端和浏览器面板,让用户无需离开应用即可审查、运行并预览智能体对代码的改动。diff 面板以红绿高亮显示增删行,支持接受或评论;终端面板可直接运行项目命令,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成审查后可直接在应用内接受改动并创建 pull request。
César de la Fuente 实验室利用 Codex 和 ChatGPT 在现存及灭绝物种的基因组中搜索抗菌候选分子,以对抗耐药性感染。该方法借助 AI 加速从海量基因数据中识别潜在抗菌肽,为药物研发提供新路径。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 物理模拟器迁移到 C++,并总结了可复用的方法。项目先构建数值一致性校验框架,再用 Vibe CLI 生成调用树并派上百个智能体整理文档,最后采用人工把关的规划、编码、测试、审查智能体工作流逐模块迁移。
推荐理由:原文给出了用智能体迁移遗留代码的完整工作流和三条可复用原则,读者可直接借鉴到同类项目。
MIT 研究员借助 GPT-5.6 Sol 与 Codex 自主运行量子计算实验,完成结果分析与量子比特校准。该组合展示了 AI 智能体在科研场景中端到端执行复杂实验流程的能力。
1Password 工程师使用 Codex 快速构建新功能和内部工具,在保持严格安全策略的同时达到生产就绪状态,工程效率提升 21%。
OpenAI 内部数据显示,编码智能体正在重塑其 AI 研究流程,显著提升实验速度与任务复杂度。该文章首次披露了智能体使用率、实验迭代频率及研究加速的早期数据,展示了智能体在推动研究效率方面的实际作用。
GitHub 推出 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型中选择执行计划,以平衡质量、成本与延迟。它支持 Single、Cascade、Critique 三种执行模式,在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点且成本降低 67%。
推荐理由:原文给出了多模型编排的三种执行模式与基准测试结果,读者可据此判断它在质量与成本之间的取舍。
GitHub Copilot app 支持在同一项目上并行运行多个 AI 智能体会话,每个会话独立执行任务、互不干扰,并拥有各自的 Git worktree 和上下文,用户可随时切换且无需重新解释。通过 sessions view 可同时跟踪多个任务进度,例如在示例仓库 tailspin-toys 中并行实现 funded sort 功能、可访问性审查和测试运行,从而减少等待和上下文切换时间。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,是面向编码和智能体场景的最强工作模型。
推荐理由:官方给出了编码、网页开发与知识工作场景的基准提升和半价定价,读者可据此评估升级价值。
Meta 今日发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,专为本地智能体场景设计,采用 Apache 2.0 许可。模型由 2B 视觉编码器和 28B 文本解码器组成,支持图像、视频输入及多模态工具调用,并附带 DFlash 投机解码加速。
推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可据此评估它在端侧智能体场景的适用性。
微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。
推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。
Google DeepMind 发布三款新 Gemini 模型。Gemini 3.6 Flash 相比 3.5 Flash 减少 17% 输出 token 用量。
推荐理由:官方给出三款新模型的定价、token 效率与关键基准提升,读者可据此评估其在智能体工作流中的成本与性能取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调而成的轻量网络安全模型,用于快速发现、验证和修复软件漏洞。
推荐理由:原文给出了轻量安全模型的定位、基准成绩和内部落地效果,读者可据此判断它在漏洞挖掘场景中的实际价值。
IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。
推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。
Mistral 宣布 Le Chat 正式更名为 Vibe,成为同时覆盖办公与编码的统一智能体,原对话、设置和订阅计划全部保留。Vibe 提供 Work Mode 处理收件箱、研究、文档起草等多步骤任务,以及 Code Mode 支持远程编码会话,并推出 VS Code 扩展和 CLI 更新。
推荐理由:原文完整说明了 Le Chat 更名 Vibe 后的双模式能力与订阅方案,读者可据此判断它如何覆盖办公与编码两类工作流。
Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。
推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。
Mistral 基于开源编码助手 Vibe 构建了一个自主智能体,自动为 Rails 代码库生成或改进 RSpec 测试,并在 CI/CD 中无人干预运行。它通过 AGENTS.md 提供分步执行计划、按文件类型拆分技能文件,并加入 RuboCop 和 SimpleCov 自定义工具强制验证。
推荐理由:原文给出了用 AGENTS.md、技能文件和自定义工具构建测试智能体的完整方法,读者可直接迁移到自己的项目。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。Vibe 现已在 Le Chat Pro 和 Team 套餐上线,支持按量付费或自带 API key;Devstral 2 转为付费 API 访问,Experiment 套餐仍提供免费额度。
推荐理由:官方介绍了终端原生编码智能体的新能力和定价变化,读者可据此判断是否迁移或升级使用。
Mistral AI 发布下一代编码模型 Devstral 2(123B)和 Devstral Small 2(24B),均采用宽松开源许可,Devstral 2 在 SWE-bench Verified 上取得 72.2% 的成绩,并推出原生 CLI 工具 Mistral Vibe 实现端到端代码自动化。
推荐理由:原文给出了新模型在 SWE-bench Verified 上的得分、与闭源模型的差距以及 API 定价,读者可据此判断开源编码模型的实际水平与成本。
Mistral 发布 Codestral 25.08,接受补全提升 30%、保留代码增加 10%、失控生成减少 50%,并推出包含 Devstral、Codestral Embed 和 Mistral Code 插件的完整企业编码栈,支持云端、VPC 或本地部署。Capgemini、Abanca、SNCF 等企业已在生产环境使用该方案。
推荐理由:原文给出了 Codestral 25.08 的量化提升和完整企业级编码栈的部署方式,读者可据此评估自托管方案的价值。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出了两款模型的基准分数、定价和开源范围,读者可据此评估其在编码智能体场景的性价比。
Mistral 发布企业级 AI 编程助手 Mistral Code,整合 Codestral、Devstral 等四款模型与 IDE 插件、本地部署和企业工具,支持微调与私有化部署。产品基于开源项目 Continue 构建,今日开放 JetBrains 和 VSCode 的私有测试,已获 Abanca、SNCF 和 Capgemini 等企业采用。
推荐理由:原文给出了产品定位、部署方式和客户案例,读者可以据此判断企业级 AI 编程助手市场的竞争格局。
Mistral AI 发布 Codestral Embed,这是其首个专为代码设计的嵌入模型,在真实代码数据的检索场景中表现突出,显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:原文给出了首个代码专用嵌入模型的性能对比、定价和分块建议,读者可据此评估其在代码检索场景的适用性。
Mistral AI 与 All Hands AI 合作推出面向软件工程任务的智能体大模型 Devstral,在 SWE-Bench Verified 上取得 46.8% 的成绩,超过此前开源最优模型 6 个百分点以上,并以 Apache 2.0 协议免费开源。
推荐理由:原文给出了基准成绩、开源许可和本地部署门槛,读者可据此评估它作为开源编码智能体的实际可用性。