8月22日2026 · 星期六

从 30 条抓取中筛选 12 条 · twitter × 9 账号 · 00:46 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. OpenAI 扩展 API 访问,并在 ChatGPT Work 和 Codex 积分计划中逐步推出8.0
  2. DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp8.0
  3. OpenAI 宣布 GPT-5.6 Sol API 价格下调超 20%,为期 3 个月8.0
  4. Qwen 在 SGLang 食谱中发布 Qwen3.8-27B 的 NVFP4 + DFlash2 配方7.0
  5. deepdoctection:支持多 OCR 引擎的开源 PDF 表格提取工具7.0
  6. Claude Code 技能包为独立开发者自动化 15 项营销任务7.0
  7. 两本 GitHub 书籍解析 Claude Code 架构与设计取舍7.0
  8. 开发者分享社区 Claude 插件 eli5 的安装命令7.0
  9. DESIGN.md:面向编码代理的机器可读设计契约7.0
  10. 构建长期运行AI代理的五大模式7.0
  11. 不要将复杂的AI评估简化为单一分数7.0
  12. Matt Pocock 试验多智能体 /implement-spec 技能7.0
018.0

OpenAI 扩展 API 访问,并在 ChatGPT Work 和 Codex 积分计划中逐步推出

OpenAI 宣布一项新功能现已在 API 上可用,并正在 ChatGPT Work 和 Codex 积分计划的合格套餐中逐步推出。公告明确表示 Pro、Plus 和 Business 订阅的使用情况保持不变。推文链接到 OpenAI API 定价页面,表明该变化涉及一个新模型或功能及其相关费用。 此次推出表明 OpenAI 正在优先考虑企业和开发者导向的计划,可能让 ChatGPT Work 和 Codex 用户率先体验新功能。对于开发者和企业而言,API 可用意味着他们可以将新功能集成到自己的应用中,而 Pro、Plus 和 Business 使用情况不变则暗示了功能的战略分层。这可能会加速依赖 Codex 进行编码和 ChatGPT Work 提高生产力的团队的采用。 公告未指明正在推出的是哪个模型或功能,但链接到定价页面暗示存在付费或计量组件。ChatGPT Work 被描述为一个由 GPT-5.6 驱动的环境,可以利用文件、连接工具和桌面应用的上下文,而 Codex 计划使用代币计量的积分系统,具有滚动的 5 小时配额。推文明确指出 Pro、Plus 和 Business 订阅的使用情况保持不变,这意味着这些层级的现有用户不会立即看到变化。推文本身未提供具体日期、基准或定价数字。

@OpenAI

Now available on the API and rolling out across eligible plans for ChatGPT Work and Codex credits. Pro, Plus, and Business subscription usage remains unchanged. https://developers.openai.com/api/docs/pricing

Pricing | OpenAI APIdevelopers.openai.com · 直连原文
背景
OpenAI 提供多个订阅层级:Free、Plus、Pro、Business 和 Enterprise,每个层级有不同的使用限制和功能。ChatGPT Work 是一个面向团队的新计划,提供一个可以与文件、工具和桌面应用交互的 AI 环境,用于自动执行创建电子表格和文档等任务。Codex 是 OpenAI 专注于编码的产品,集成到 ChatGPT 计划中,采用积分系统,使用量以代币和积分计量,不同层级提供不同的配额。API 允许开发者以编程方式访问 OpenAI 模型,其定价与消费者订阅分开。

8月21日 19:34在 X 打开#OpenAI #API #ChatGPT #Codex #AI

028.0

DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp

DeepSeek 发布了实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,现已在 DeepSeek API 平台上线。该模型在文本能力(包括智能体、推理和世界知识)上与 DeepSeek-V4-Flash 持平,同时在多模态智能体基准测试上取得重大飞跃,性能接近 Opus-4.8。DeepSeek Harness 0.1.1 也于同日发布,开箱即支持新模型。 此次发布为 DeepSeek 生态带来了有竞争力的多模态智能体能力,开发者无需切换供应商即可构建支持视觉的智能体。该模型在文本性能上持平,并在多模态基准上接近 Opus-4.8,有望加速 DeepSeek 模型在需要视觉理解的智能体工作流中的采用。API 即时可用和 Harness 支持降低了实验门槛。 该模型为实验性版本,可通过 DeepSeek API 上的 model='deepseek-v4-flash-vision-exp' 访问。DeepSeek Harness 0.1.1 是一个基于 Cordis 插件系统的开源智能体框架,现已开箱即支持该模型。公告称该模型可在各种智能体框架中顺畅运行,将视觉理解与多种工具结合。公告未提供具体基准分数和定价细节。

@deepseek_ai串推 2 条2 段 · 2 张图片 · 2 个视频DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n原推文媒体预览+3展开原推文收起原推文

@deepseek_ai串推 2 条

DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀 🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge. 🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major leap over V4-Flash, bringing multimodal agent performance close to Opus-4.8. Try it with model='deepseek-v4-flash-vision-exp'. DeepSeek Harness 0.1.1 was released today with out-of-the-box support for the new model. 1/n

Multimodality unlocks more agent use cases. 👀 V4-Flash-Vision-Exp works smoothly across agent frameworks, combining visual understanding with a wide range of tools to unlock more practical workflows. 2/n

背景
DeepSeek 是一家中国 AI 实验室,以发布可与领先闭源模型竞争的开源权重模型而闻名。多模态模型可以同时处理文本和图像,使智能体能够理解视觉信息。智能体基准测试评估模型在需要工具使用、规划和环境交互的任务上的表现。Opus-4.8 是另一家实验室的高性能模型,此处用作性能对比参照。DeepSeek Harness 是一个开源智能体框架,可简化使用 DeepSeek 模型构建和运行智能体的过程。

8月21日 09:17在 X 打开#AI #DeepSeek #multimodal #model release #API

038.0

OpenAI 宣布 GPT-5.6 Sol API 价格下调超 20%,为期 3 个月

OpenAI 宣布在未来 3 个月内将 GPT-5.6 Sol 的 API 和积分价格下调超过 20%。thsottiaux 在 X 平台上强调了这一消息,并指出效率、可靠性和性能是当前的重点。此前,GPT-Image-2 刚刚推出了透明背景支持。 此次降价直接降低了使用 OpenAI 旗舰模型的成本,使更多开发者和企业能够负担得起先进的 AI 能力。这反映了 AI API 市场的竞争压力,并可能加速 GPT-5.6 Sol 在生产环境中的采用。此举也与 OpenAI 在提升能力的同时改善效率的目标一致。 根据 OpenRouter 的数据,GPT-5.6 Sol 目前的价格为每百万输入 token 2.50 美元、每百万输出 token 15.00 美元,而 Eden AI 列出的价格分别为 5.00 美元和 30.00 美元,表明不同供应商或时间点的定价可能存在差异。此次超过 20% 的降价适用于 API 和积分,但仅限 3 个月。公告未说明具体的新价格,也未明确是否适用于所有 token 类型(如缓存读取/写入、网络搜索)。

@thsottiaux引用推文1 个视频Sol shines brighter today. Efficiency, reliability and performance are the name of the game.原推文媒体预览展开原推文收起原推文

@thsottiaux

Sol shines brighter today. Efficiency, reliability and performance are the name of the game.

@OpenAI

As we continue to push the frontier of capabilities while improving efficiency, we're dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months.

背景
GPT-5.6 Sol 是 OpenAI GPT-5.6 系列中的旗舰模型,定位为能力最强、价格最高的版本,另有 Terra 和 Luna 等更便宜的替代品。API 定价通常按每百万 token(输入和输出)计算,OpenRouter 等供应商会以不同价格转售访问权限。GPT-Image-2 的透明背景生成功能允许用户创建带有 alpha 通道的图像,适用于设计和电商场景。

8月21日 19:43在 X 打开#OpenAI #GPT-5.6 #API pricing #AI industry #announcement

047.0

Qwen 在 SGLang 食谱中发布 Qwen3.8-27B 的 NVFP4 + DFlash2 配方

阿里巴巴 Qwen 宣布在 SGLang 食谱中为 Qwen3.8-27B 模型新增 NVFP4 + DFlash2 配方。这些配方由 SGLang 项目贡献,提供了优化的推理起点。公告强调了社区对该方法的验证。 这为从业者提供了官方支持且经社区验证的配置,用于加速和优化热门 Qwen 模型的推理。它降低了采用先进量化和投机解码技术的门槛,有望降低服务成本和延迟。此举反映了将硬件特定优化集成到主流推理框架中的更广泛趋势。 NVFP4 是 NVIDIA 面向 Blackwell GPU 的 4 位浮点格式,可降低内存带宽,同时保持接近更高精度的准确性。DFlash2 是一种投机解码方法,据 NVIDIA 称可在 Blackwell GPU 上实现高达 15 倍的加速。这些配方可在 SGLang 食谱中获取,地址为 docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B。

@Alibaba_Qwen引用推文1 张图片Fresh recipes just dropped! ⚡ NVFP4 + DFlash2 for Qwen3.8-27B now in the SGLang cookbook. Thanks for the support! @sgl_project原推文媒体预览展开原推文收起原推文

@Alibaba_Qwen

Fresh recipes just dropped! ⚡ NVFP4 + DFlash2 for Qwen3.8-27B now in the SGLang cookbook. Thanks for the support! @sgl_project

@sgl_project

Just pushed DFlash2 (@inco_ai) recipes to the Qwen3.8 27B cookbook⚡️ https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B The community has been seeing great results with NVFP4 + DFlash2, and these recipes should be some very good starting points to play with. More Qwen3.8 27B updates on the way 🫡

背景
SGLang 是一个开源的大语言模型服务框架,以其高吞吐量和灵活的调度而闻名。Qwen3.8-27B 是阿里巴巴 Qwen 系列的最新模型,旨在以适中的规模提供强大的性能。量化通过降低模型精度来减少内存使用并加速推理,而投机解码则使用较小的草稿模型并行预测多个 token,从而加快生成速度。

8月21日 07:58在 X 打开#Qwen #SGLang #NVFP4 #DFlash2 #inference optimization

057.0

deepdoctection:支持多 OCR 引擎的开源 PDF 表格提取工具

GitHub_Daily 发推推荐 deepdoctection,这是一个开源工具,可以从 PDF 或扫描件中提取表格、标题、段落和图片。它支持 Tesseract、docTR 和 AWS 三种 OCR 引擎,并能将表格直接输出为可用的 HTML。作者表示在表格提取方面它优于同类产品。 从 PDF 中提取表格是文档处理中的常见痛点,尤其是合同、发票和研报等场景。deepdoctection 提供了一个实用的开源解决方案,减少了手动清理工作,并支持多种 OCR 后端,对处理非结构化文档的开发者和研究人员很有价值。 deepdoctection 使用 Python 构建,并利用深度学习进行表格检测和提取。它支持 Tesseract、docTR 和 AWS 作为 OCR 引擎,并以 HTML 格式输出表格。项目托管在 GitHub:https://github.com/deepdoctection/deepdoctection。推文称其在表格提取方面优于作者尝试过的其他工具。

@GitHub_Daily原推文1 张图片若直接把 PDF 文件里的表格复制出来,大概率都是乱套,还得手动调整修改。 偶然发现 deepdoctection,只要把 PDF 或扫描件丢进去,表格、标题、段落、图片全都能处理。 支持 Tesseract、docTR 和 AWS 三个文字识别引擎,表格直接输出成能用的 HTML。 GitHub:http://github.com/deepdoctection/deepdoctection 之前用过几个同类的产品,感觉表格提取这块 deepdoctection 更胜一筹。 日常要批量处理合同、发票、研报这类 PDF 的朋友,可以跑一遍看看效果。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

若直接把 PDF 文件里的表格复制出来,大概率都是乱套,还得手动调整修改。 偶然发现 deepdoctection,只要把 PDF 或扫描件丢进去,表格、标题、段落、图片全都能处理。 支持 Tesseract、docTR 和 AWS 三个文字识别引擎,表格直接输出成能用的 HTML。 GitHub:http://github.com/deepdoctection/deepdoctection 之前用过几个同类的产品,感觉表格提取这块 deepdoctection 更胜一筹。 日常要批量处理合同、发票、研报这类 PDF 的朋友,可以跑一遍看看效果。

背景
PDF 表格提取很困难,因为 PDF 将文本和图形存储为定位元素,而不是结构化表格。OCR(光学字符识别)引擎将扫描图像转换为机器可读文本;Tesseract 是广泛使用的开源 OCR 引擎,docTR 是基于深度学习的 OCR 库,AWS 提供云端 OCR 服务。deepdoctection 将表格检测模型与这些 OCR 引擎结合,重建表格并输出为 HTML。

8月21日 13:30在 X 打开#PDF #OCR #table extraction #deepdoctection #open source

067.0

Claude Code 技能包为独立开发者自动化 15 项营销任务

一个名为 ai-marketing-claude 的全新开源 Claude Code 技能包可自动化 15 项营销任务,包括使用 5 个并行代理进行网站审计、文案撰写、电子邮件和 PDF 报告生成。它专为独立开发者和小型机构设计,帮助他们自行处理营销工作。该工具已在 GitHub 上发布,地址为 github.com/zubair-trabzada/ai-marketing-claude。 该工具解决了独立开发者和小型机构在开发产品的同时还要处理营销工作的常见痛点,他们通常需要花费数天时间进行客户提案的前期分析。通过使用并行 AI 代理自动化这些任务,它可以显著减少时间和精力,使专业营销工作流程无需聘请专家即可实现。这反映了 AI 辅助生产力工具赋能个人像完整团队一样运作的更广泛趋势。 该技能包在网站审计期间运行 5 个并行代理,从内容、转化率、SEO、竞争对手和品牌五个维度进行评分。它还可以处理文案撰写、电子邮件发送、广告排期,并为客户导出 PDF 报告。该工具是开源的,可在 GitHub 上获取,但推文未提供详细的基准测试或定价信息。用户应验证 AI 生成的营销内容的质量,并确保其与品牌声音一致。

@GitHub_Daily原推文1 张图片一人一公司自己开发网站、写文案、搞 SEO、发邮件,营销、接待客户,实在是忙不过来。 ai-marketing-claude 把 15 项营销工作做成了 Claude Code 的技能包,一条命令搞定。 审计网站时同时跑 5 个 Agent 并行分析,内容、转化率、SEO、竞品、品牌五个维度打分。 GitHub:http://github.com/zubair-trabzada/ai-marketing-claude 审计之外也能写文案、发邮件、投放排期,最后还能导出 PDF 直接交给客户。 接单做营销方案的时候,光前期分析就能吃掉一两天,有这个帮跑初稿省事不少。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

一人一公司自己开发网站、写文案、搞 SEO、发邮件,营销、接待客户,实在是忙不过来。 ai-marketing-claude 把 15 项营销工作做成了 Claude Code 的技能包,一条命令搞定。 审计网站时同时跑 5 个 Agent 并行分析,内容、转化率、SEO、竞品、品牌五个维度打分。 GitHub:http://github.com/zubair-trabzada/ai-marketing-claude 审计之外也能写文案、发邮件、投放排期,最后还能导出 PDF 直接交给客户。 接单做营销方案的时候,光前期分析就能吃掉一两天,有这个帮跑初稿省事不少。

背景
Claude Code 是一个 AI 编码助手,可以通过“技能”进行扩展——技能是可复用的指令和工具包,用于自动化特定任务。并行代理是指同时运行多个 AI 代理来分析问题的不同方面,从而加快工作流程。营销审计通常涉及评估网站的内容、SEO、转化优化、竞争格局和品牌一致性。独立开发者往往缺乏时间或专业知识来手动执行这些任务,因此自动化非常有价值。

8月21日 10:00在 X 打开#AI tools #marketing automation #Claude Code #open source #productivity

077.0

两本 GitHub 书籍解析 Claude Code 架构与设计取舍

@GitHub_Daily 的一条推文重点介绍了 'harness-books' GitHub 仓库中的两本书,它们系统地解释了 Claude Code 的内部架构。第一本书聚焦运行时结构,涵盖权限管理、上下文治理和错误恢复。第二本书将 Claude Code 与 Codex 进行对比,分析两个工具如何处理相同任务以及涉及的设计取舍。 Claude Code 是一个广泛使用的 AI 编码代理,但其源代码复杂,博客文章零散,开发者很难理解其设计原理。这些书籍提供了结构化、精选的资源,节省时间并帮助开发者掌握 AI 编码代理背后的架构决策。对于任何构建或定制类似工具的人来说,这都很有价值,因为它从真实系统中提炼了实用知识。 这些书籍托管在 github.com/wquguru/harness-books,并以中文撰写。第一本书按章节围绕运行时结构、权限管理、上下文治理和错误恢复展开。第二本书对 Claude Code 和 Codex 在相同任务上进行并排比较,突出设计取舍。推文强调理解设计选择背后的“为什么”,而不仅仅是阅读代码。

@GitHub_Daily原推文1 张图片想搞懂 Claude Code 底层怎么设计的,若直接看源码无从入手,而博客又讲得太零散。 最近在 GitHub 上发现 harness-books 用两本书把架构拆解讲清楚了,结构比我预想的清晰。 第一本聚焦运行时结构,权限怎么管、上下文怎么治理、出错了怎么恢复,逐章拆开讲。 重点不是研究代码怎么写,而是让我们了解清楚为什么要这样设计。 GitHub:http://github.com/wquguru/harness-books 第二本把 Claude Code 和 Codex 放一起进行对比,同一任务两个工具怎么做,设计取舍在哪。 想理解 AI 编码 Agent 的设计逻辑,或者打算自己造一个,这两本读完能省掉不少翻代码的时间。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

想搞懂 Claude Code 底层怎么设计的,若直接看源码无从入手,而博客又讲得太零散。 最近在 GitHub 上发现 harness-books 用两本书把架构拆解讲清楚了,结构比我预想的清晰。 第一本聚焦运行时结构,权限怎么管、上下文怎么治理、出错了怎么恢复,逐章拆开讲。 重点不是研究代码怎么写,而是让我们了解清楚为什么要这样设计。 GitHub:http://github.com/wquguru/harness-books 第二本把 Claude Code 和 Codex 放一起进行对比,同一任务两个工具怎么做,设计取舍在哪。 想理解 AI 编码 Agent 的设计逻辑,或者打算自己造一个,这两本读完能省掉不少翻代码的时间。

背景
Claude Code 是 Anthropic 推出的基于终端的 AI 编码助手,能够理解并修改代码库。像 Claude Code 和 OpenAI 的 Codex 这样的 AI 编码代理使用大型语言模型来执行编写代码、调试和重构等任务。理解它们的架构——如何管理上下文、权限和错误恢复——对于想要扩展或构建类似工具的开发者至关重要。模型上下文协议(MCP)是一个开放标准,帮助 AI 代理与外部工具和数据源交互。

8月21日 04:00在 X 打开#Claude Code #AI coding agents #architecture #GitHub #software design

087.0

开发者分享社区 Claude 插件 eli5 的安装命令

一位开发者(@trq212)正在考虑是否将某个插件设为官方插件,并分享了社区 Claude 插件“eli5”的安装命令。命令为“claude plugin marketplace add anthropics/claude-plugins-community”和“claude plugin install eli5@claude-community”。这表明在 Claude Code 生态系统中有一个新插件可供测试。 这一公告表明 Claude 插件生态系统正在发展,为开发者提供了更多增强工作流程的工具。“eli5”插件可能旨在简化复杂解释,对于需要快速理解或传达技术概念的开发者来说可能很有价值。将其设为官方插件将提高其在社区中的可见度和可信度。 该插件通过 Claude Code 插件市场安装,需要先添加市场“anthropics/claude-plugins-community”,然后安装插件“eli5@claude-community”。开发者仍在考虑是否将其设为官方插件,这意味着它可能处于早期或实验阶段。公告中未提供具体功能、性能基准或定价细节。

@trq212原推文debating whether we should make it an official plugin, but you can try installing it here to try with these commands: claude plugin marketplace add anthropics/claude-plugins-community claude plugin install eli5@claude-community展开原推文收起原推文

@trq212

debating whether we should make it an official plugin, but you can try installing it here to try with these commands: claude plugin marketplace add anthropics/claude-plugins-community claude plugin install eli5@claude-community

背景
Claude Code 是 Anthropic 推出的 AI 编程助手,支持通过插件扩展其功能。插件通过市场分发,市场是插件的集合,可以使用“claude plugin marketplace add”命令添加。添加市场后,可以使用“claude plugin install <插件名>@<市场名>”命令安装单个插件。“eli5”这个名字很可能代表“Explain Like I'm 5”(像对五岁小孩一样解释),暗示该插件可以简化复杂主题。

8月21日 19:32在 X 打开#Claude #plugin #AI tools #developer tools

097.0

DESIGN.md:面向编码代理的机器可读设计契约

Bilgin Ibryam(@bibryam)介绍了 DESIGN.md,这是 Google Labs 推出的一种新格式,将机器可读的设计令牌与人类可读的设计说明相结合。该格式存储在带有 YAML 前置元数据的 Markdown 文件中,使编码代理能够访问精确的设计值,如颜色、排版、间距和圆角。这创建了一个可复用的设计契约,可以在不同的编码会话和代理之间共享。 随着 AI 编码代理的普及,在代理生成的代码中保持 UI 一致性是一个重大挑战。DESIGN.md 通过提供一种标准化的方式向代理传达设计决策,减少了视觉漂移和返工。这可以提高 AI 辅助前端开发的质量和连贯性,使依赖编码代理的开发者和团队受益。 DESIGN.md 格式在 google-labs-code/design.md 仓库中定义,并被 Agent Protocol 的 AIP-4 规范引用。它使用 YAML 前置元数据存储机器可读令牌,使用 Markdown 文本存储人类可读说明。EveryDev.ai 等工具提供了将 DESIGN.md 令牌导出为 Tailwind 主题配置或 W3C DTCG JSON 格式的命令。该格式仍处于早期阶段,其采用和生态系统支持尚未建立。

@bibryam原推文1 张图片⭐ DESIGN.md for coding agents Machine-readable design tokens + human-readable rationale = a reusable design contract across sessions. A useful idea for keeping agent-generated UI coherent. The format is still early, but worth watching. https://github.com/google-labs-code/design.md原推文媒体预览展开原推文收起原推文

@bibryam

⭐ DESIGN.md for coding agents Machine-readable design tokens + human-readable rationale = a reusable design contract across sessions. A useful idea for keeping agent-generated UI coherent. The format is still early, but worth watching. https://github.com/google-labs-code/design.md

背景
设计令牌是与平台无关的变量,代表颜色、字体和间距等设计决策。它们通常用于设计系统中,以确保跨不同平台和实现的一致性。编码代理(如 Cursor 或 GitHub Copilot)是基于自然语言指令生成或修改代码的 AI 工具。这些代理的一个持续挑战是,它们可能生成偏离预期设计的 UI 代码,尤其是在多个会话中。DESIGN.md 旨在通过提供一个代理可以读取的单一文件来理解设计系统,从而解决这个问题。

8月21日 21:05在 X 打开#AI-assisted development #design tokens #coding agents #UI consistency #developer tools

107.0

构建长期运行AI代理的五大模式

Bilgin Ibryam 的一条推文强调了构建持久、长期运行的 AI 代理的五种模式:检查点、审批门、受管控的记忆、事件驱动处理和专家团队。这些模式来自 Addy Osmani 和 Shubham Saboo 在 Turing Post 上发表的一篇文章。核心转变是从无状态请求处理器转向持久、受管控的系统。 随着 AI 代理从简单的无状态交互转向复杂的长期运行工作流,这些模式解决了可靠性、安全性和成本效率等关键生产挑战。它们为构建必须运行数小时或数天的代理系统的工程师提供了一个实用框架。这种转变对于将 AI 代理从演示扩展到现实世界的企业应用至关重要。 这五种模式是:检查点(保存进度以避免失败时完全重新执行)、审批门(在风险操作前暂停以供人工或策略审查)、受管控的记忆(受控、有权限的代理记忆存储)、事件驱动处理(对事件做出反应而非轮询)以及专家团队(委托给专门的子代理)。文章标题为《生产差距:构建长期运行 AI 代理的 5 种模式》,发表于 2026 年 5 月 26 日。文章强调,当前大多数代理实际上是无状态的,而这些模式将它们转变为生产级后台进程。

@bibryam原推文1 张图片Five patterns for long-running agents: • checkpoints • approval gates • governed memory • event-driven processing • specialist fleets The shift: stateless request handler → durable, governed system. By @addyosmani + @Saboo_Shubham_: https://www.turingpost.com/p/the-production-gap-5-patterns-for-building-long-running-ai-agents原推文媒体预览展开原推文收起原推文

@bibryam

Five patterns for long-running agents: • checkpoints • approval gates • governed memory • event-driven processing • specialist fleets The shift: stateless request handler → durable, governed system. By @addyosmani + @Saboo_Shubham_: https://www.turingpost.com/p/the-production-gap-5-patterns-for-building-long-running-ai-agents

背景
长期运行的 AI 代理是旨在跨小时或天数保持执行状态、记忆和工作流连续性的系统,不同于每次交互后重置的典型无状态聊天机器人。检查点是一种架构模式,代理在战略点保存进度,以避免失败时重新执行。审批门是工作流检查点,在风险操作前暂停自主代理,需要人工或策略审查。受管控的记忆指控制系统,用于控制代理存储和访问哪些信息,确保合规并降低 token 成本。事件驱动处理允许代理异步响应触发器,而专家团队则涉及将任务委托给多个专门的代理。

8月21日 07:58在 X 打开#AI agents #software architecture #patterns #production systems

117.0

不要将复杂的AI评估简化为单一分数

一位曾参与Gemini项目的资深AI从业者警告,不要将复杂的评估套件压缩成一个综合分数。他认为单一数字会掩盖关键退化,例如模型在简单任务上表现提升,但在复杂金融分析上表现下降。他主张采用分优先级的详细评估,而非加权平均。 这一建议针对AI开发中常见的失败模式:决策者要求简化指标,导致糟糕的产品决策。其重要性在于AI系统具有多个质量维度,单一分数可能掩盖前沿用例中的退化。该指导对任何构建或评估AI系统的团队都具有相关性。 作者举例说明问题:模型在摘要任务上从85%提升到89%,在基础事实问答上从80%提升到85%,但在复杂金融分析上从70%下降到63%。他反对加权分数,因为这会在主观判断上制造虚假的数学精确性。相反,他建议维护一份按优先级排序的评估列表,并让人员深入检查详细结果,以判断新系统是否对用户更好。

@realmadhuguru引用推文How to build great evals - part 5 Stop dumbing down the results from your beautiful, complex eval suite into one single score. This often happens because some senior wants a simplified number to make decisions. Happened to us in the early days of Gemini. And I see it happening with a lot of teams. This is the tyranny of the average. AI systems do not have a simple dimension of quality. Imagine a model that goes from: 85% -> 89% on simple summarization 80% -> 85% on basic factual QA 70% -> 63% on complex financial analysis A single score obscures the fact that the model got worse on your frontier use case. The immediate reaction to this is to come up with a weighted score. The problem with this is that you have created false, mathematical procession around a judgment call. So what should you do? - keep a prioritized list of your evals per the ladder we discussed in part 4 yesterday. - get people who can look at the details and don’t look for abstracted simplicity. - Understand all the critical eval results in depth, where they fail, where they shine and make a decision on whether your new AI system is better or worse for your users. Next post tomorrow! Drop your eval questions below and I will answer in future posts. Share this with your teammates. And your managers who run from complexity.展开原推文收起原推文

@realmadhuguru

How to build great evals - part 5 Stop dumbing down the results from your beautiful, complex eval suite into one single score. This often happens because some senior wants a simplified number to make decisions. Happened to us in the early days of Gemini. And I see it happening with a lot of teams. This is the tyranny of the average. AI systems do not have a simple dimension of quality. Imagine a model that goes from: 85% -> 89% on simple summarization 80% -> 85% on basic factual QA 70% -> 63% on complex financial analysis A single score obscures the fact that the model got worse on your frontier use case. The immediate reaction to this is to come up with a weighted score. The problem with this is that you have created false, mathematical procession around a judgment call. So what should you do? - keep a prioritized list of your evals per the ladder we discussed in part 4 yesterday. - get people who can look at the details and don’t look for abstracted simplicity. - Understand all the critical eval results in depth, where they fail, where they shine and make a decision on whether your new AI system is better or worse for your users. Next post tomorrow! Drop your eval questions below and I will answer in future posts. Share this with your teammates. And your managers who run from complexity.

@realmadhuguru

How to build great evals - part 4 The reason enterprises struggle with building decent AI systems is the lack of an eval strategy. You need a laddered eval strategy, for your unique use cases, with multiple evals on the cost/realism spectrum. Here are the key kinds of evals you need: Hill-climb long evals : this pushes the frontier of your product and you need to continually refresh this to improve quality and expand your feature base. Regression evals : Did we break the product of today while hill climbing? Smoke test evals: safety and the absolute basics that just can’t go wrong. Not necessarily hard questions, but important to not get wrong. Eg product identity. Launch evals: often close to an online test with real-ish traffic. Less control, but the most realistic. More in tomorrow’s post! Share with your teammates who will benefit!

背景
作者引用了之前文章中的“阶梯式评估策略”,包括用于前沿功能的爬坡评估、防止破坏现有功能的回归评估、针对安全基础的冒烟测试,以及模拟真实流量的发布评估。该框架帮助团队平衡创新与稳定性。“平均值的暴政”是一个概念,警告聚合指标可能掩盖不同子群体或用例之间的重要差异。

8月21日 22:32在 X 打开#AI evaluation #ML engineering #best practices #Gemini

127.0

Matt Pocock 试验多智能体 /implement-spec 技能

知名 TypeScript 教育者 Matt Pocock 正在试验一个实验性的 /implement-spec 技能,该技能使用多智能体子代理来自主实现规格说明和工单。该技能接收规格说明和工单,在子代理中进行代码库研究,以最大并发度在并行子代理中实现所有工单,对照规格说明审查最终代码,并清理所有工作树。Pocock 在 GitHub 上分享了该技能,并承认他之前对可靠性和成本的疑虑仍然存在。 这种方法通过将工作委派给并发子代理,可以显著加速大型编码任务,有可能让开发者“以最少的监督自主完成大量工作”。如果成功,它可能会影响 AI 编码代理在软件开发中的使用方式,从确定性循环转向涌现式的多智能体委派。然而,其试验性质和已承认的不确定性意味着实际影响仍有待观察。 该技能可在 GitHub 上获取:https://github.com/mattpocock/skills/blob/main/skills/in-progress/implement-spec/SKILL.md,并标记为“进行中”。它依赖于多智能体能力,可能需要诸如 CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS 之类的实验性设置。Pocock 指出,与手工编写的确定性循环相比,它“可能更昂贵、更不可靠”,但可能具有涌现性优势。目前尚未提供基准测试或成功指标。

@mattpocockuk串推 2 条2 段I'm trying out an /implement-spec skill Essentially a multi-agent implementer that: - Takes in a spec and tickets - Does codebase research in a subagent - Implements all the tickets in subagents with maximum concurrency - Reviews the final code against the spec - Cleans up all worktrees Should be able to smash out huge chunks of work autonomously with minimal supervision. https://github.com/mattpocock/skills/blob/main/skills/in-progress/implement-spec/SKILL.md展开原推文收起原推文

@mattpocockuk串推 2 条

I'm trying out an /implement-spec skill Essentially a multi-agent implementer that: - Takes in a spec and tickets - Does codebase research in a subagent - Implements all the tickets in subagents with maximum concurrency - Reviews the final code against the spec - Cleans up all worktrees Should be able to smash out huge chunks of work autonomously with minimal supervision. https://github.com/mattpocock/skills/blob/main/skills/in-progress/implement-spec/SKILL.md

Same doubts I had here still apply. We'll see! https://x.com/mattpocockuk/status/2089685052015673604 > 引用 @mattpocockuk: Going to try bitter lesson-ing myself this week > > Instead of hand-rolling a deterministic loop to tackle tickets from /to-tickets > > I'll just get an agent to delegate to subagents. > > Probably more expensive, less reliable, but may have emergent benefits

skills/skills/in-progress/implement-spec/SKILL.md at main · mattpocock/skillsgithub.com · 直连原文
背景
多智能体 AI 编码流水线将规格说明、实现和审查等任务分离到独立的角色中,通常使用 git 工作树来管理并行更改。Rich Sutton 的“苦涩教训”认为,通用的、由计算驱动的方法随着时间的推移往往优于人工设计的启发式方法,Pocock 在说自己在“苦涩教训”自己时引用了这一点。子代理是由主代理生成的小型 AI 代理,用于并发处理子任务,这一功能在一些编码助手(如带有实验性标志的 Claude Code)中可用。

8月21日 10:15在 X 打开#AI agents #software development #automation #TypeScript #multi-agent