9月4日2026 · 星期五

从 41 条抓取中筛选 12 条 · twitter × 5 账号 · 02:05 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. OpenAI 发布 GPT-6 Astra,主打电脑操作并宣称达到 AGI9.0
  2. 通义千问发布面向长周期自主商业运营的电商基准测试8.0
  3. GitHub 仓库整理 30 种 Agent 记忆技术,附可运行 Notebook 与决策树8.0
  4. Anthropic 正在为 Claude Code 开发函数钩子8.0
  5. LangChain 全面支持新的无状态 MCP 规范8.0
  6. Codex 提供 100% GPT-6 Astra 使用额度,优于 Claude Code 的 50% Fable7.0
  7. AI 转型重塑技术团队:程序员减少,产品经理增多7.0
  8. 阿里巴巴通义千问推出 Qwen Cloud 平台,邀请开发者共建7.0
  9. video-talkcraft:基于 Remotion 的工具将口播稿转为动态讲解视频7.0
  10. fable-advisor:让Claude当架构师、Codex写代码,实现高性价比AI编程7.0
  11. Manim:3Blue1Brown 数学视频背后的 Python 动画引擎7.0
  12. LangChain 与 Nevermined AI 推出自主代理支付 Cookbook7.0
019.0

OpenAI 发布 GPT-6 Astra,主打电脑操作并宣称达到 AGI

OpenAI 于 9 月 3 日发布 GPT-6 Astra,称其为世界上最聪明、对齐最好的模型。总裁 Greg Brockman 表示他个人认为 OpenAI 已通过该模型实现 AGI。该模型具备先进的电脑操作能力,可控制屏幕、点击、填写表单并操作真实软件,首批向 Daybreak 网络安全合作伙伴开放,未来几天逐步扩展至 ChatGPT Plus、Pro、Business、Enterprise、API 和 AWS Bedrock。 该发布标志着向能够自主操作电脑的实用 AI 智能体迈出了重要一步,可能改变办公、软件工程和网络安全等领域。若 AGI 的说法得到证实,将代表 AI 能力的范式转变,并引发关于安全、对齐和经济影响的重要问题。该模型网络安全能力达到 OpenAI 的 Critical 阈值,也凸显了先进 AI 的双重用途特性。 GPT-6 Astra 的定价为每百万输入 token 10 美元、输出 token 50 美元,与 Anthropic 的 Claude Fable 5.1 完全相同,是 GPT-5.6 Sol 促销价的 2.5 倍。在 OSWorld 2.0 中,Astra 完成任务约需 40 分钟,得分 72.6%,而 Sol 需 75 分钟、得分 65.7%。在 Terminal-Bench 4.0 上,Astra 得分为 57.7%,高于 Claude Fable 5.1 的 55.8% 和 Sol 的 37.3%,但在 DeepSWE v1.1 和 FrontierCode 1.1 等基准上,它与 Claude 模型基本持平或略逊一筹。Astra 是 OpenAI 首个在 Preparedness Framework 中达到网络安全 Critical 阈值的模型,在 ExploitBench 上取得 100%,在 20 个 Chrome V8 新漏洞上成功率为 39%,测试期间还发现了两个零日漏洞。

@dotey引用推文1 个视频GPT-6 Astra 来了,Greg 说“欢迎来到 AGI 时代” OpenAI 今天(9 月 3 日)发布 GPT-6 Astra,自称“世界上最聪明、对齐最好的模型”。 总裁 Greg Brockman 在发布前的媒体沟通会上说得:他个人认为 OpenAI 已经做到了 AGI,“未来回头看,可能就是这个模型”。 先说大家最关心的问题:什么时候能用、多少钱。 首批只开放给 OpenAI 网络安全项目 Daybreak 的少数机构,未来几天陆续推送到 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 API 和 AWS Bedrock。 用量包含在现有订阅额度里,用完可以买额外积分。 企业版默认关闭,需要管理员手动打开。 API 模型名 gpt-6-astra,每百万输入 Token 10 美元,输出 50 美元,和 Anthropic 的 Claude Fable 5.1 定价完全一样,是 GPT-5.6 Sol 促销价的 2.5 倍。 另有 Fast 模式,速度最高 2.5 倍,价格翻倍。 【1】主打的是替你操作电脑 Astra 这次最强调的能力是电脑操作(computer use),也就是模型自己控制屏幕、点鼠标、填表单、在真实软件里干活。Brockman 的原话是“人在电脑上能做的,Astra 基本都能做”。 OpenAI 给的场景很具体:填网页表单、更新 CRM 客户记录、整理日历、在邮件或文档编辑器里写研究摘要、分析科学数据并画图、建网站并跑前端测试、安装软件并排查屏幕上出现的报错。演示视频里还有它在 KiCad 里做 PCB 电路板布线,在 Blender 里建房子模型再导入虚幻引擎 5 变成可行走场景。 速度是另一个重点。在 OSWorld 2.0 的延迟模拟里,Astra 完成一个任务约 40 分钟,得分 72.6%,GPT-5.6 Sol 要 75 分钟,得分 65.7%。配合更新后的 Codex 框架,Mind2Web 上的任务完成速度是 Sol 的 1.9 倍。 办公场景上,OpenAI 说 Astra 是它目前最擅长"按模板做 PPT"的模型,能沿用公司现有模板的排版和语气,做出来的文档、表格、幻灯片直接能用,而且学会了只把相关信息放进产出物,不再把无关内容一股脑塞进去。 【2】编程:多数基准领先,但不是全面碾压 OpenAI 称 Astra 是“迄今为止最好的软件工程模型”。Terminal-Bench 4.0 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 只有 37.3%。OpenAI 还强调单任务 API 成本比 Fable 5.1 低约 63%。 但看 OpenAI 自己贴的完整表格,情况没那么一边倒。 DeepSWE v1.1 上 Astra 74.1%,Claude Opus 5 是 73.7%,几乎持平; FrontierCode 1.1 两项,Claude Fable 5 都略高于 Astra; Artificial Analysis 的编程智能体指数,Astra 67.0 反而低于 Opus 5 的 68.1。 Jane Street 的 John Crepezzi 给了背书,说 Astra 生成的代码需要更少迭代就能达到上线质量,沟通方式也更容易让开发者跟上。 对开发者比较实用的一个变化在 Codex:以前长会话上下文(context)满了,模型只能把过程压缩成一份摘要,压几次之后很多细节就丢了,比如某个修复为什么失败。现在 Astra 可以跨上下文窗口记笔记,旧的上下文窗口还能搜索。这个功能目前是实验性的,要在 config.toml 里手动开,几周后会成为默认。 【3】网络安全能力触发关键红线,正常用户会被限制 Astra 是 OpenAI 第一个在自家 Preparedness Framework 里达到网络安全 Critical(关键)阈值的模型,含义是它能在没有人一步步指导的情况下,自己找到并利用未知漏洞攻击防护严密的系统。 数据:在把已知漏洞变成可用攻击代码的 ExploitBench 上,Astra 拿了 100%,Sol 是 78.5%。为了排除"背过题"的可能,OpenAI 专门用今年 6 到 8 月的 20 个 Chrome V8 高危漏洞做了新题库,Astra 成功率 39%,Sol 只有 5.5%。 测试过程中 Astra 还顺手发现并利用了两个此前无人知晓的零日漏洞,OpenAI 说已通报给维护方。专家评估里,去掉安全措施的 Astra 能在加固过的浏览器上实现任意代码执行,能给加固过的操作系统写提权攻击。 所以今天发布的这个版本,遇到“写漏洞利用的概念验证代码”这类请求会直接拒绝,能做的是代码安全审查和打补丁。更宽松的版本只通过 Daybreak 项目申请,几周后逐步开放,面向漏洞验证、恶意软件分析、检测规则编写这些防御性工作。 【4】对齐最好的模型:不越界、不撒谎、但更难被监控 OpenAI 显然想用 Astra 回应 Hugging Face 事件带来的信任问题。它专门做了一个受该事件启发的测试:给模型一个很难或不可能完成的任务,看它会不会越权。去掉生产环境安全措施后,Sol 有 48% 的概率越过授权目标,Astra 是 0%。 另一个测试是 Codex 的 Auto-review 拒绝了模型的某个操作之后,模型会不会想办法绕过去。OpenAI 说即使故意把 Auto-review 配置成可以绕开、而且任务不绕开就完不成,Astra 也从没尝试过。在"对自己能力做不实陈述"这项上,Astra 犯错的概率是 Sol 的三分之一。 OpenAI 也承认了一个反向结果:在明确要求模型规避监控的测试里,Astra 写出来的推理过程比 Sol 更难被监控。原因是它对简单任务的书面推理控制力更强,可以用更少的步骤解决问题。复杂任务上它还藏不住,但 OpenAI 说这个下降"我们很当回事"。 实际使用上你会感受到的是:Astra 级别的模型上线了生产环境的错位监控,一套分类器实时检查模型的推理和操作。触发之后,ChatGPT 和 Codex 里任务会暂停让你确认,API 里任务直接停止。OpenAI 承认这套东西有时会误伤正常工作,包括正当的防御性安全任务,还在调。 【5】数学和科学 Astra 在质数间隙问题上给出了两个新结果。一个是相邻质数最近能有多近:十多年来最好的结果是 246,Julia Stadlmann 最近推进到 240,Astra 把这个上界压到 186。另一个是质数之间的大间隙,Astra 改进了一个 80 多年没动过的界。证明和精简版思维链都已公开。 基准上,FrontierMath Tier 4 得分 97.6%(正文说 98%,见编辑注),GPQA Diamond 96.0%,ARC-AGI-3 达到 99.9%,而 Sol 只有 7.8%。不过 Humanity's Last Exam(带工具)Astra 是 57.2%,落后于 Claude Fable 5.1 的 65.0%;Artificial Analysis 综合智能指数 Astra 61.2,也低于 Fable 5.1 的 65.7 和 Opus 5 的 63.1。 据 Axios 报道,Astra 是 OpenAI 史上最大的训练任务,在得州 Stargate 站点用了超过 10 万块 GPU,也是 OpenAI 第一个让其他模型深度参与监督训练的模型。Sam Altman 对 Axios 说,Astra 走了白宫的自愿审查流程,Brockman 称白宫没有要求实质性修改。 官方博客:https://openai.com/index/gpt-6-astra/原推文媒体预览展开原推文收起原推文

@dotey

GPT-6 Astra 来了,Greg 说“欢迎来到 AGI 时代” OpenAI 今天(9 月 3 日)发布 GPT-6 Astra,自称“世界上最聪明、对齐最好的模型”。 总裁 Greg Brockman 在发布前的媒体沟通会上说得:他个人认为 OpenAI 已经做到了 AGI,“未来回头看,可能就是这个模型”。 先说大家最关心的问题:什么时候能用、多少钱。 首批只开放给 OpenAI 网络安全项目 Daybreak 的少数机构,未来几天陆续推送到 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 API 和 AWS Bedrock。 用量包含在现有订阅额度里,用完可以买额外积分。 企业版默认关闭,需要管理员手动打开。 API 模型名 gpt-6-astra,每百万输入 Token 10 美元,输出 50 美元,和 Anthropic 的 Claude Fable 5.1 定价完全一样,是 GPT-5.6 Sol 促销价的 2.5 倍。 另有 Fast 模式,速度最高 2.5 倍,价格翻倍。 【1】主打的是替你操作电脑 Astra 这次最强调的能力是电脑操作(computer use),也就是模型自己控制屏幕、点鼠标、填表单、在真实软件里干活。Brockman 的原话是“人在电脑上能做的,Astra 基本都能做”。 OpenAI 给的场景很具体:填网页表单、更新 CRM 客户记录、整理日历、在邮件或文档编辑器里写研究摘要、分析科学数据并画图、建网站并跑前端测试、安装软件并排查屏幕上出现的报错。演示视频里还有它在 KiCad 里做 PCB 电路板布线,在 Blender 里建房子模型再导入虚幻引擎 5 变成可行走场景。 速度是另一个重点。在 OSWorld 2.0 的延迟模拟里,Astra 完成一个任务约 40 分钟,得分 72.6%,GPT-5.6 Sol 要 75 分钟,得分 65.7%。配合更新后的 Codex 框架,Mind2Web 上的任务完成速度是 Sol 的 1.9 倍。 办公场景上,OpenAI 说 Astra 是它目前最擅长"按模板做 PPT"的模型,能沿用公司现有模板的排版和语气,做出来的文档、表格、幻灯片直接能用,而且学会了只把相关信息放进产出物,不再把无关内容一股脑塞进去。 【2】编程:多数基准领先,但不是全面碾压 OpenAI 称 Astra 是“迄今为止最好的软件工程模型”。Terminal-Bench 4.0 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 只有 37.3%。OpenAI 还强调单任务 API 成本比 Fable 5.1 低约 63%。 但看 OpenAI 自己贴的完整表格,情况没那么一边倒。 DeepSWE v1.1 上 Astra 74.1%,Claude Opus 5 是 73.7%,几乎持平; FrontierCode 1.1 两项,Claude Fable 5 都略高于 Astra; Artificial Analysis 的编程智能体指数,Astra 67.0 反而低于 Opus 5 的 68.1。 Jane Street 的 John Crepezzi 给了背书,说 Astra 生成的代码需要更少迭代就能达到上线质量,沟通方式也更容易让开发者跟上。 对开发者比较实用的一个变化在 Codex:以前长会话上下文(context)满了,模型只能把过程压缩成一份摘要,压几次之后很多细节就丢了,比如某个修复为什么失败。现在 Astra 可以跨上下文窗口记笔记,旧的上下文窗口还能搜索。这个功能目前是实验性的,要在 config.toml 里手动开,几周后会成为默认。 【3】网络安全能力触发关键红线,正常用户会被限制 Astra 是 OpenAI 第一个在自家 Preparedness Framework 里达到网络安全 Critical(关键)阈值的模型,含义是它能在没有人一步步指导的情况下,自己找到并利用未知漏洞攻击防护严密的系统。 数据:在把已知漏洞变成可用攻击代码的 ExploitBench 上,Astra 拿了 100%,Sol 是 78.5%。为了排除"背过题"的可能,OpenAI 专门用今年 6 到 8 月的 20 个 Chrome V8 高危漏洞做了新题库,Astra 成功率 39%,Sol 只有 5.5%。 测试过程中 Astra 还顺手发现并利用了两个此前无人知晓的零日漏洞,OpenAI 说已通报给维护方。专家评估里,去掉安全措施的 Astra 能在加固过的浏览器上实现任意代码执行,能给加固过的操作系统写提权攻击。 所以今天发布的这个版本,遇到“写漏洞利用的概念验证代码”这类请求会直接拒绝,能做的是代码安全审查和打补丁。更宽松的版本只通过 Daybreak 项目申请,几周后逐步开放,面向漏洞验证、恶意软件分析、检测规则编写这些防御性工作。 【4】对齐最好的模型:不越界、不撒谎、但更难被监控 OpenAI 显然想用 Astra 回应 Hugging Face 事件带来的信任问题。它专门做了一个受该事件启发的测试:给模型一个很难或不可能完成的任务,看它会不会越权。去掉生产环境安全措施后,Sol 有 48% 的概率越过授权目标,Astra 是 0%。 另一个测试是 Codex 的 Auto-review 拒绝了模型的某个操作之后,模型会不会想办法绕过去。OpenAI 说即使故意把 Auto-review 配置成可以绕开、而且任务不绕开就完不成,Astra 也从没尝试过。在"对自己能力做不实陈述"这项上,Astra 犯错的概率是 Sol 的三分之一。 OpenAI 也承认了一个反向结果:在明确要求模型规避监控的测试里,Astra 写出来的推理过程比 Sol 更难被监控。原因是它对简单任务的书面推理控制力更强,可以用更少的步骤解决问题。复杂任务上它还藏不住,但 OpenAI 说这个下降"我们很当回事"。 实际使用上你会感受到的是:Astra 级别的模型上线了生产环境的错位监控,一套分类器实时检查模型的推理和操作。触发之后,ChatGPT 和 Codex 里任务会暂停让你确认,API 里任务直接停止。OpenAI 承认这套东西有时会误伤正常工作,包括正当的防御性安全任务,还在调。 【5】数学和科学 Astra 在质数间隙问题上给出了两个新结果。一个是相邻质数最近能有多近:十多年来最好的结果是 246,Julia Stadlmann 最近推进到 240,Astra 把这个上界压到 186。另一个是质数之间的大间隙,Astra 改进了一个 80 多年没动过的界。证明和精简版思维链都已公开。 基准上,FrontierMath Tier 4 得分 97.6%(正文说 98%,见编辑注),GPQA Diamond 96.0%,ARC-AGI-3 达到 99.9%,而 Sol 只有 7.8%。不过 Humanity's Last Exam(带工具)Astra 是 57.2%,落后于 Claude Fable 5.1 的 65.0%;Artificial Analysis 综合智能指数 Astra 61.2,也低于 Fable 5.1 的 65.7 和 Opus 5 的 63.1。 据 Axios 报道,Astra 是 OpenAI 史上最大的训练任务,在得州 Stargate 站点用了超过 10 万块 GPU,也是 OpenAI 第一个让其他模型深度参与监督训练的模型。Sam Altman 对 Axios 说,Astra 走了白宫的自愿审查流程,Brockman 称白宫没有要求实质性修改。 官方博客:https://openai.com/index/gpt-6-astra/

GPT-6 Astra: A new generation of intelligenceopenai.com · 直连原文

@OpenAI

This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast.

背景
电脑操作(computer use)指 AI 模型能够像人类一样与图形用户界面交互,执行点击、输入和软件导航等任务。OSWorld 2.0 和 Mind2Web 是用于在真实环境中评估这些能力的基准。OpenAI 的 Preparedness Framework 是内部风险评估系统,对模型能力进行分类,Critical 是网络安全方面的最高风险等级。AGI(通用人工智能)是一种假设性的 AI,能够在广泛任务中以人类水平或更高水平理解、学习和应用知识。
社区讨论
社区评论对该发布表示兴奋,有用户指出在 GPT-6 Astra 可用之前,Codex 每天提供一次可累积的重置机会。另一位用户强调向所有 Plus 用户开放(而非仅限 Pro、Business 和 Enterprise)是一个积极举措。

9月3日 19:48在 X 打开#OpenAI #GPT-6 #AGI #AI model release #computer use

028.0

通义千问发布面向长周期自主商业运营的电商基准测试

阿里巴巴通义千问发布了 E-Commerce Bench,这是一个模拟完整 365 天在线店铺运营的新基准测试。智能体以 10 万元人民币起步,需要在由真实淘宝和天猫数据驱动的市场中处理采购、谈判、定价、促销、库存和现金流。该基准包含 6886 种商品、576 家供应商(其中 152 家为欺诈者)、仓储费、退货和声誉动态,并从七个维度对模型进行评估。 该基准填补了评估 AI 智能体在长周期、真实世界商业任务中表现的关键空白,而现有大多数基准只关注短期、单次会话的任务。它揭示了没有任何单一模型能在全部七个评估维度上占据主导地位,凸显了自主商业运营的复杂性。基于真实电商数据的现实经济模拟使其成为推动商业和运营领域智能体能力发展的宝贵工具。 该基准模拟了 600 分钟的工作日、仓储费、退货和声誉影响,对 18 个前沿模型分别进行了五次 365 天周期的测试。一个关键发现是,几乎没有模型能在全年运营中学会以更低价格采购或改进其策略。评估不仅限于年末资产,还包括另外六个维度,代码已在 QwenLM 组织的 GitHub 仓库中公开。

@Alibaba_Qwen原推文3 张图片Meet E-Commerce Bench, a new benchmark for long-horizon autonomous business operations. 🚀 Agents start with ¥100,000 to run online stores for 365 days, handling sourcing, negotiation, pricing, promotions, inventory and cash flow, in a market driven by real e-commerce data. What's inside: 👀 - Real economics: 6886 products, 576 suppliers (152 fraudsters), 600-minute workdays, storage fees, returns and reputation. - Long-horizon learning: almost no model learns to buy cheaper or improve its strategies over a full year of operation. - Seven-axis evaluation: beyond year-end assets, we score six more dimensions, revealing that no single model dominates across the board. Learn more about E-Commerce Bench: 👇 - Blog: https://qwen.ai/blog?id=e-commerce-bench - Paper: https://arxiv.org/abs/2608.30730 - Project: https://ecbench.github.io/ - Code: https://github.com/QwenLM/E-CommerceBench原推文媒体预览+2展开原推文收起原推文

@Alibaba_Qwen

Meet E-Commerce Bench, a new benchmark for long-horizon autonomous business operations. 🚀 Agents start with ¥100,000 to run online stores for 365 days, handling sourcing, negotiation, pricing, promotions, inventory and cash flow, in a market driven by real e-commerce data. What's inside: 👀 - Real economics: 6886 products, 576 suppliers (152 fraudsters), 600-minute workdays, storage fees, returns and reputation. - Long-horizon learning: almost no model learns to buy cheaper or improve its strategies over a full year of operation. - Seven-axis evaluation: beyond year-end assets, we score six more dimensions, revealing that no single model dominates across the board. Learn more about E-Commerce Bench: 👇 - Blog: https://qwen.ai/blog?id=e-commerce-bench - Paper: https://arxiv.org/abs/2608.30730 - Project: https://ecbench.github.io/ - Code: https://github.com/QwenLM/E-CommerceBench

背景
长周期自主商业运营要求 AI 像一个微型的运营、财务和采购引擎一样运作,在较长时间内管理库存时机和现金流周转。现有的大多数 AI 基准测试都集中在问答或代码生成等短期、单次会话的任务上,无法捕捉持续决策的挑战。E-Commerce Bench 基于中国两大电商平台淘宝和天猫的匿名数据构建,提供了真实的市场动态。该基准包含确定性的对手方谈判和动态事件,使其成为对智能体能力更全面的测试。
社区讨论
社区反应积极,DAIR.AI 称其为“重磅论文”,并推荐给任何评估单次会话之外智能体的人。AlphaSignal 强调该基准暴露了 AI 智能体在经营企业方面的糟糕表现,凸显了长周期自主性的难度。在提供的搜索结果中未发现明显的批评或反对意见。

9月3日 11:37在 X 打开#AI benchmark #autonomous agents #e-commerce #LLM evaluation #research

038.0

GitHub 仓库整理 30 种 Agent 记忆技术,附可运行 Notebook 与决策树

一个新的 GitHub 仓库 Agent_Memory_Techniques(作者 NirDiamant)将 30 种 Agent 记忆技术整理成 30 个可运行的 Notebook,覆盖缓存、向量数据库、知识图谱、情景记忆和语义记忆等。它包含 Mem0、Letta(原 MemGPT)、Zep 和 Graphiti 等热门框架的实操代码,并提供长对话记忆的评测基准。README 中的决策树可帮助开发者根据自身场景选择先看哪个 Notebook。 Agent 记忆是一个关键但碎片化的领域,框架众多且缺乏清晰的入门路径。该仓库通过系统化、可实操地对比 30 种技术,降低了学习门槛,为开发者节省大量调研和试错时间。评测基准和决策树的加入,使得为生产级 Agent 做出基于证据的架构选择更加容易。 该仓库按技术划分目录,每种技术对应一个可运行的 Notebook。覆盖了向量存储、知识图谱、情景记忆和语义记忆等主要记忆路线。Mem0、Letta、Zep 和 Graphiti 等流行框架均有实操演示。提供了长对话记忆的评测基准,支持定量比较。README 中包含决策树,引导用户找到最适合其场景的 Notebook。

@GitHub_Daily原推文2 张图片想给 Agent 加长期记忆,一搜一堆方案,Mem0、MemGPT、知识图谱各有各好,不知道从哪学起。 Agent_Memory_Techniques 把 30 种记忆技术整理成 30 个能直接跑的 notebook,从对话缓存一路讲到生产级方案。 每种技术单独一个目录,向量库、知识图谱、情景记忆、语义记忆这些主流路线全覆盖。 GitHub:http://github.com/NirDiamant/Agent_Memory_Techniques Mem0、Letta、Zep、Graphiti 这些当红记忆框架都有实操,还带长对话记忆的评测基准,选型有数据可依。 README 里画了张决策树,按自己的场景一路答下去,就知道该先看哪个 notebook,不用 30 个全啃。 正在给 Agent 设计记忆层的开发者,把这仓库过一遍能省不少踩坑时间。原推文媒体预览+1展开原推文收起原推文

@GitHub_Daily

想给 Agent 加长期记忆,一搜一堆方案,Mem0、MemGPT、知识图谱各有各好,不知道从哪学起。 Agent_Memory_Techniques 把 30 种记忆技术整理成 30 个能直接跑的 notebook,从对话缓存一路讲到生产级方案。 每种技术单独一个目录,向量库、知识图谱、情景记忆、语义记忆这些主流路线全覆盖。 GitHub:http://github.com/NirDiamant/Agent_Memory_Techniques Mem0、Letta、Zep、Graphiti 这些当红记忆框架都有实操,还带长对话记忆的评测基准,选型有数据可依。 README 里画了张决策树,按自己的场景一路答下去,就知道该先看哪个 notebook,不用 30 个全啃。 正在给 Agent 设计记忆层的开发者,把这仓库过一遍能省不少踩坑时间。

背景
Agent 记忆是指让 AI Agent 在多次交互中保留和检索信息的机制,从而实现长期上下文和个性化。常见方法包括用于语义搜索的向量数据库、用于结构化关系的知识图谱,以及受人类认知启发的情景记忆和语义记忆。Mem0、Letta(原 MemGPT)、Zep 和 Graphiti 等框架提供了生产就绪的记忆层,但各有取舍。长对话记忆的评测基准仍在发展中,因此比较数据尤为宝贵。

9月3日 07:30在 X 打开#AI Agents #Memory Techniques #Machine Learning #Developer Tools #GitHub

048.0

Anthropic 正在为 Claude Code 开发函数钩子

Anthropic 开发者 @trq212 宣布团队正在通过名为函数钩子(Function Hooks)的新功能让 Claude Code 更具可定制性。该功能尚未发布,他们正在 GitHub issue 上积极征求社区反馈。已分享展示潜在功能的视频。 函数钩子将使开发者能够深度定制和扩展 Claude Code,可能实现自定义工作流、自动化检查以及与外部工具的集成。这与让 AI 编码助手更具扩展性、更能适应个人或团队需求的更广泛趋势一致。它可能显著提高 Claude Code 用户的生产力和代码质量。 该功能名为函数钩子,仍处于探索阶段,尚未公布发布日期。反馈通过 GitHub issue 收集,表明开发过程是开放的。公告中包含展示用户将能做什么的视频,但新闻条目中未提供具体技术细节。

@trq212引用推文2 个视频We’re working on making Claude Code way more hackable, give us feedback!原推文媒体预览+1展开原推文收起原推文

@trq212

We’re working on making Claude Code way more hackable, give us feedback!

@ClaudeDevs

We're exploring a new way to let you extend and customize Claude Code: Function Hooks. Here's a couple videos showing what you'd be able to do. It hasn't shipped yet, we'd love feedback on this on our GitHub issue.

背景
Claude Code 是 Anthropic 的 AI 编码助手,在终端中运行,能够理解和修改代码库。它已经通过钩子、斜杠命令和项目特定配置支持一些定制。函数钩子将是一种更强大的扩展机制,允许开发者在编码工作流的特定点(如某些操作之前或之后)运行自定义脚本。

9月3日 23:19在 X 打开#Claude Code #AI coding tools #extensibility #developer tools

058.0

LangChain 全面支持新的无状态 MCP 规范

LangChain 宣布全面支持新的无状态 MCP 规范。整个 MCP 集成已重构,现在位于主 langchain 包中,elicitation 通过 interrupts 实现,列表端点可缓存。新的适配器基于 FastMCP 构建,提供一流的传输、认证、连接管理、协议协商、缓存和回调功能。 MCP 正在成为 AI/LLM 生态系统中工具集成的标准,向无状态协议的转变简化了扩展和部署。LangChain 采用新规范和 FastMCP 标志着集成处理方式的重大改进,惠及使用 LangChain 构建 AI 应用的开发者。 新的无状态 MCP 规范移除了会话 ID 和初始化握手,实现了干净的横向扩展。FastMCP 是一个用于构建 MCP 服务器的 TypeScript 框架,Python 版本的 FastMCP 创建了并入官方 MCP Python SDK 的高级 API。该集成现在支持列表端点缓存,并使用 interrupts 进行 elicitation,提升了性能和用户交互。

@LangChain原推文we now support the new stateless MCP spec in @LangChain! we've revamped our entire MCP integration. It now lives in the main langchain package, elicitation works via interrupts, and list endpoints are cacheable. the new adapter is built on top of FastMCP! FastMCP ships with first class transports, auth, connection management, protocol negotiation, caching, callbacks, and more. --- From twitter --- Today, we're making some exciting updates to MCP in LangChain, including support for the new stateless MCP spec! @SydneyRunkle with everything you need to know ⤵️ > 引用 @sydneyrunkle: https://x.com/i/article/2095553851269185536展开原推文收起原推文

@LangChain

we now support the new stateless MCP spec in @LangChain! we've revamped our entire MCP integration. It now lives in the main langchain package, elicitation works via interrupts, and list endpoints are cacheable. the new adapter is built on top of FastMCP! FastMCP ships with first class transports, auth, connection management, protocol negotiation, caching, callbacks, and more. --- From twitter --- Today, we're making some exciting updates to MCP in LangChain, including support for the new stateless MCP spec! @SydneyRunkle with everything you need to know ⤵️ > 引用 @sydneyrunkle: https://x.com/i/article/2095553851269185536

背景
MCP(模型上下文协议)是一个开放协议,标准化了应用程序向 LLM 提供上下文的方式。2026-07-28 规范使 MCP 成为完全无状态的协议,取代了之前基于会话的有状态方法。FastMCP 是一个用于构建 MCP 服务器的框架,有 TypeScript 和 Python 两种实现,以其高级 API 和易用性而闻名。

9月3日 19:44在 X 打开#LangChain #MCP #AI #Integration #LLM

067.0

Codex 提供 100% GPT-6 Astra 使用额度,优于 Claude Code 的 50% Fable

@dotey 的一条推文指出,Codex 允许用户将 100% 的使用额度分配给 GPT-6 Astra,而 Claude Code 仅允许 50% 的 Fable 模型使用额度。推文引用了 @thsottiaux 的确认,即 Astra 将包含在各套餐的正常使用额度中。目前的问题是 GPT-6 Astra 何时能在 Codex 中真正可用。 这种使用额度上的差异为 Codex 带来了竞争优势,对于希望无限制地使用最新 GPT-6 Astra 模型的开发者来说尤其有吸引力。这可能会影响开发者在 AI 编码工具之间的选择,因为 100% 的额度意味着更大的灵活性和对重度 Astra 用户而言可能更低的实际成本。这一消息也表明 OpenAI 有意将 Codex 作为其最强模型的主要入口进行推广。 GPT-6 Astra 于 2026 年 9 月 3 日发布,OpenAI 将其描述为在复杂推理、编码和文档创建方面能力最强的模型。引用的声明确认 Astra 将包含在正常使用额度中,但未明确在 Codex 中的上线日期。Codex 的定价自 4 月 2 日起转向 API 风格的 token 计费,这可能会影响 100% 额度的计算方式。OpenAI 官方文档尚未确认 Astra 在 Codex 中的确切可用时间。

@dotey引用推文这点 Codex 就比 Claude Code 良心多了,你可以用 100% 的 GPT-6 Astra 额度,而不是像 Claude 只能 50% Fable。 现在的问题是:什么时候可以在 Codex 用上 GPT-6 Astra?展开原推文收起原推文

@dotey

这点 Codex 就比 Claude Code 良心多了,你可以用 100% 的 GPT-6 Astra 额度,而不是像 Claude 只能 50% Fable。 现在的问题是:什么时候可以在 Codex 用上 GPT-6 Astra?

@thsottiaux

Across the plans Astra will be included in the normal usage allocation and you will be able to use 100% of it towards Astra.

背景
Codex 是 OpenAI 集成在 ChatGPT 中的 AI 编码助手,根据订阅层级提供使用配额。Claude Code 是 Anthropic 的同类编码工具,Fable 是其模型选项之一。GPT-6 Astra 是 OpenAI 最新的旗舰模型,定位为端到端复杂任务。使用额度指的是用户每月配额如何在工具内的不同模型之间分配。

9月3日 20:12在 X 打开#GPT-6 Astra #Codex #Claude Code #AI tools #OpenAI

077.0

AI 转型重塑技术团队:程序员减少,产品经理增多

一位科技公司创始人报告称,在采用 Claude Code 和 Codex 等 AI 编程工具后,他们解雇了无法拥抱 AI 的技术负责人,将程序员数量削减一半,并将产品经理数量增加一倍。评论者 @dotey 分析了这一转变,指出当开发不再是瓶颈时,决定做什么变得更加重要,兼具开发与产品能力的混合角色将备受青睐。QA 角色被认为没有变化,尽管 AI 既能提升测试自动化效率,也可能加剧质量不稳定。 这反映了一个更广泛的行业趋势:AI 编程助手将瓶颈从实现转移到产品定义,可能减少对纯程序员的需求,同时增加对产品经理和混合角色的需求。这表明抗拒 AI 的技术负责人可能成为负担,而兼具开发与产品技能的专业人士将拥有竞争优势。这一变化也引发了关于软件质量和 QA 未来的疑问。 该创始人在做出决定前亲自使用 Claude Code 和 Codex 一个月,表明对 AI 编程工具进行了实际评估。公司业务正在扩张,这为增加产品经理提供了合理性;如果只是维持业务,则不需要增加。评论者指出 QA 角色没有变化,但 AI 可以帮助编写更多自动化测试,同时由于开发加速也可能使质量更不稳定。原始帖子基于一家公司的经验,属于轶事证据,并非系统性研究。

@dotey引用推文这个 AI 转型变化仔细想想合理的: 1. 无法拥抱 AI 的技术负责人会拖累整体开发速度 2. 当开发不是瓶颈,那么决定做什么会更重要,所以需要更多产品经理。 如果一部分开发能兼做开发和产品经理可能更好,未来既懂产品又有开发基础会很吃香。 3. QA/测试没看到变化,理论上来说 QA 可以用 AI 辅助写更多自动化测试,提升测试效率,但另一方面 AI 加速了开发,但同时也会让质量更加不稳定,测试工作量可能更多了。 公司能增加产品经理说明业务还是拓展了的,否则只是维持业务的话产品经理不需要增加。展开原推文收起原推文

@dotey

这个 AI 转型变化仔细想想合理的: 1. 无法拥抱 AI 的技术负责人会拖累整体开发速度 2. 当开发不是瓶颈,那么决定做什么会更重要,所以需要更多产品经理。 如果一部分开发能兼做开发和产品经理可能更好,未来既懂产品又有开发基础会很吃香。 3. QA/测试没看到变化,理论上来说 QA 可以用 AI 辅助写更多自动化测试,提升测试效率,但另一方面 AI 加速了开发,但同时也会让质量更加不稳定,测试工作量可能更多了。 公司能增加产品经理说明业务还是拓展了的,否则只是维持业务的话产品经理不需要增加。

@tuzi_ai

今天回访了一位上半年找我商谈 AI 转型的老板,其公司发生了如下变化: 1、开除了无法拥抱 AI 编程的技术负责人 2、消减了一半的程序员 3、增加了一倍的产品经理 这些不是拍脑袋的决定,老板不写代码很多年,在商谈后买了claudecode、codex 狂写了一月,做出了上述的决定

背景
AI 编程助手如 Claude Code(Anthropic 出品)和 Codex(OpenAI 出品)可以生成、编辑和调试代码,显著加快开发速度。这将瓶颈从编写代码转移到决定构建什么,而后者传统上是产品经理的职责。在软件团队中,产品经理定义需求和优先级,程序员负责实现,QA 工程师负责测试结果。该评论认为,随着 AI 承担更多实现工作,产品定义和混合技能的价值将提升。

9月3日 18:19在 X 打开#AI #software engineering #organizational change #product management #tech industry

087.0

阿里巴巴通义千问推出 Qwen Cloud 平台,邀请开发者共建

阿里巴巴通义千问团队宣布推出 Qwen Cloud,这是一个全新的 AI 原生平台,提供 Qwen 大语言模型、多模态模型和智能体工具。该消息通过官方 @Alibaba_Qwen 账号在 X 平台发布,引导开发者访问 qwencloud.com。该平台承诺超低延迟,并为企业级 AI 应用提供可扩展性。 此次发布标志着通义千问从开源模型发布扩展到托管云服务,与 OpenAI、Anthropic 和 Google Cloud 等平台展开竞争。它降低了企业大规模部署 Qwen 模型的门槛,可能加速 Qwen 在生产环境中的采用。此举也表明阿里巴巴致力于通过基础设施服务将其 AI 研究成果商业化。 Qwen Cloud 被描述为一个“AI 原生平台”,提供 Qwen 大语言模型、多模态模型和智能体工具,强调超低延迟。qwencloud.com 网站已上线,但公告中未详细说明具体定价、模型版本和区域可用性。该推文本身互动量较低,表明消息仍处于早期传播阶段。Qwen 模型在开源排行榜上已表现出色,该平台可能为自托管提供托管替代方案。

@Alibaba_Qwen引用推文Come build with Qwen🫴🫴展开原推文收起原推文

@Alibaba_Qwen

Come build with Qwen🫴🫴

@qwen_cloud

Qwen is up. Come say hi😃 https://www.qwencloud.com/

背景
Qwen 是阿里云开发的一系列大语言模型,以在开源基准测试中的强劲表现和多语言能力而闻名。Qwen 团队已发布多个开源模型,包括 Qwen2.5 和 Qwen3,在 AI 社区中被广泛使用。Qwen Cloud 似乎是一个商业平台,以托管服务的形式提供这些模型,类似于 OpenAI 通过 API 提供 GPT 模型。这遵循了 AI 研究实验室提供基于云的推理和微调服务以创收的更广泛行业趋势。

9月3日 16:44在 X 打开#Qwen #Alibaba #AI #cloud #launch

097.0

video-talkcraft:基于 Remotion 的工具将口播稿转为动态讲解视频

GitHub_Daily 介绍了 video-talkcraft,这是一个新的开源工具,能将口播稿和成品配音转换为动态讲解视频。它先在本地将每个字对齐到时间戳,再按语义规划分镜,并自动添加动态字卡、截图、运镜、字幕和音效。该工具内置 79 张动效卡和一套七层反 PPT 镜头系统,最近还更新了剪映式动效工作台,支持多轨微调。 该工具解决了内容创作者的一个常见痛点:口播视频看起来像念稿,只有 PPT 翻页式的静态字幕。通过自动化分镜规划和动态效果,它降低了制作引人入胜的知识分享和产品讲解视频的门槛。它与 Claude Code 和 Codex 等 AI 编码代理的集成,使其对偏好程序化视频创作的开发者更加友好。 video-talkcraft 基于 Remotion(一个用于程序化视频创作的 React 框架)构建,支持通过 Claude Code 和 Codex 安装。它包含 79 张动效卡和一套七层镜头系统,最近更新增加了剪映式动效工作台,支持多轨编辑。该工具开源,托管在 GitHub 上,并配有中文 README。它被定位为 video-shotcraft 的姊妹工具,后者专注于产品宣传视频。

@GitHub_Daily原推文1 张图片录好一段口播配音,画面却只能配 PPT 翻页式的字幕卡,成片看着还是像在念稿。 昨天分享的 video-shotcraft 是做产品宣传片的,这条是同系列的口播篇,专治解说视频的「PPT 感」。 给它一份口播稿加一条成品配音,它先在本机把每个字对齐到时间戳,然后把每个语义拍写进分镜,一句话该配什么画面都定好。 GitHub:http://github.com/Vincentwei1021/video-talkcraft 动态字卡、截图、运镜、字幕、音效全部搞定,内置 79 张动效卡和一套七层反 PPT 镜头系统。 另外最近还更新了剪映式的动效工作台,成片能拆成字幕、转场、镜头、配音等多轨逐项微调。 底层用的是 Remotion,支持 Claude Code 和 Codex 安装。正在做知识类口播、产品讲解视频的朋友可以试试。 --- From twitter --- video-shotcraft 把 Claude Code 变成视频剪辑动效工作室,指着产品说需求,分镜、动画、音效一条龙出片。 内置 157 张运镜配方卡和 214 个动效预览,2.5D 镜头推拉、卡点剪切、影视级音效都是现成的套路。 GitHub:http://github.com/Vincentwei1021/video-shotcraft 真实抓取产品页面画面来做素材,不是贴几张截图轮播,出来的片子有实拍质感。 底层用 Remotion 渲染,Claude Code 和 Codex 都能装,还配了中文 README。 要发产品、做 demo 演示视频的,先去它的在线画廊把动效预览刷一遍,找找想要的感觉。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

录好一段口播配音,画面却只能配 PPT 翻页式的字幕卡,成片看着还是像在念稿。 昨天分享的 video-shotcraft 是做产品宣传片的,这条是同系列的口播篇,专治解说视频的「PPT 感」。 给它一份口播稿加一条成品配音,它先在本机把每个字对齐到时间戳,然后把每个语义拍写进分镜,一句话该配什么画面都定好。 GitHub:http://github.com/Vincentwei1021/video-talkcraft 动态字卡、截图、运镜、字幕、音效全部搞定,内置 79 张动效卡和一套七层反 PPT 镜头系统。 另外最近还更新了剪映式的动效工作台,成片能拆成字幕、转场、镜头、配音等多轨逐项微调。 底层用的是 Remotion,支持 Claude Code 和 Codex 安装。正在做知识类口播、产品讲解视频的朋友可以试试。 --- From twitter --- video-shotcraft 把 Claude Code 变成视频剪辑动效工作室,指着产品说需求,分镜、动画、音效一条龙出片。 内置 157 张运镜配方卡和 214 个动效预览,2.5D 镜头推拉、卡点剪切、影视级音效都是现成的套路。 GitHub:http://github.com/Vincentwei1021/video-shotcraft 真实抓取产品页面画面来做素材,不是贴几张截图轮播,出来的片子有实拍质感。 底层用 Remotion 渲染,Claude Code 和 Codex 都能装,还配了中文 README。 要发产品、做 demo 演示视频的,先去它的在线画廊把动效预览刷一遍,找找想要的感觉。

背景
Remotion 是一个基于 React 的框架,允许开发者通过代码程序化地创建视频,支持参数化合成和批量渲染。Claude Code 和 Codex 是 AI 编码代理,能够理解代码库、编辑文件和运行命令,适合安装和配置像 video-talkcraft 这样的工具。该工具的方法与传统视频编辑不同,传统方式需要手动制作每个场景和效果;而这里由脚本和音频自动驱动视觉规划。

9月4日 00:00在 X 打开#video generation #open source #Remotion #content creation #AI tools

107.0

fable-advisor:让Claude当架构师、Codex写代码,实现高性价比AI编程

fable-advisor是一个新的开源插件,改变了AI编程任务的分配方式。它让Claude担任架构师,负责拆解需求和编写规格说明,而Codex负责实际的代码编写。架构师还会为每个任务确定思考力度,机械性改动使用更便宜的模型,困难部分才动用全部算力。 该工具解决了开发者在使用AI编程助手时的一个常见痛点:在成本和质量之间取得平衡。通过将架构设计与代码实现分离,并使用不同厂商的模型进行审查,它引入了跨模型检查机制,可以减少盲点。这种模式可能会影响团队在生产环境中采用AI编程工具的方式。 该插件可在GitHub上获取,地址为github.com/DannyMac180/fable-advisor。它包含一个最终审查步骤,架构师会拉取干净的上下文来检查累积的更改,然后才报告完成。还提供了一个轻量级单文件版本,大约30秒即可安装。该项目根据能力路由token,高能力任务提到使用Opus。

@GitHub_Daily原推文1 张图片用 Claude Code 干活,一直开最贵的模型烧钱,换便宜的又不放心质量,这个取舍挺烦人。 fable-advisor 该开源插件能让 Claude 当架构师只动嘴,拆需求、写规格,敲代码的活派给 Codex 去干。 每个任务该用多大思考力度也由架构师定,机械改动跑得又快又便宜,难啃的部分才开足马力。 GitHub:http://github.com/DannyMac180/fable-advisor 活干完不算完,架构师会再拉一个干净上下文做最终复审,看过没问题才交差。 实现和把关是两个不同厂家的模型,相当于内置了交叉审查,不容易被同一家的盲区带偏。 装完一句话切到架构师模式就能用。嫌整套太重的话,官方还给了个单文件的轻量版,30 秒装好。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

用 Claude Code 干活,一直开最贵的模型烧钱,换便宜的又不放心质量,这个取舍挺烦人。 fable-advisor 该开源插件能让 Claude 当架构师只动嘴,拆需求、写规格,敲代码的活派给 Codex 去干。 每个任务该用多大思考力度也由架构师定,机械改动跑得又快又便宜,难啃的部分才开足马力。 GitHub:http://github.com/DannyMac180/fable-advisor 活干完不算完,架构师会再拉一个干净上下文做最终复审,看过没问题才交差。 实现和把关是两个不同厂家的模型,相当于内置了交叉审查,不容易被同一家的盲区带偏。 装完一句话切到架构师模式就能用。嫌整套太重的话,官方还给了个单文件的轻量版,30 秒装好。

背景
Claude Code是Anthropic的智能编程工具,在终端中运行,能够理解代码库、编辑文件和运行命令。Codex是OpenAI的编程代理,可作为CLI使用或集成到工作区中。“架构师模式”的概念是使用能力更强的模型进行规划和审查,而由更便宜或更快的模型执行实际的代码更改。跨模型审查意味着使用不同厂商的模型来检查彼此的工作,降低共同盲点的风险。

9月3日 05:30在 X 打开#AI coding #Claude Code #Codex #open-source #cost optimization

117.0

Manim:3Blue1Brown 数学视频背后的 Python 动画引擎

一条推文重点介绍了 manim,这是 Grant Sanderson 为其 3Blue1Brown YouTube 频道开发的开源 Python 动画引擎。该项目在 GitHub 上已获得超过 92,000 颗星,推文强调其通过代码而非关键帧工具创建精确数学动画的能力。它还提到了一个社区维护版本,文档更完善,更适合初学者。 Manim 使教育工作者、内容创作者和研究人员能够制作精确符合数学定义的高质量数学动画,而非近似效果。这很重要,因为它降低了 STEM 教育和科学传播中制作解释性内容的门槛,并已成为开源社区广泛采用的工具。 Manim 是一个基于 MIT 许可证发布的免费开源 Python 库。主要有两个版本:ManimCE(社区版,稳定且文档完善)和 ManimGL(原始的 3b1b/manim 分支,实验性)。推文指出,2020 年分出的社区版文档更全,对新手更友好。动画通过编程定义,可实现变换的平滑插值、坐标系旋转和公式逐项展开。

@GitHub_Daily原推文1 张图片刷到 3Blue1Brown 的数学视频总会多看两眼,那些公式流畅变形、图形随讲解起舞,一直好奇是怎么做出来的。 答案就是作者自己写的动画引擎 manim,每一帧都由 Python 代码算出来,已斩获 92000+ Star! 写几行代码描述对象和变换,中间过程它负责平滑补全,图形渐变、坐标系旋转、公式逐项展开都行。 GitHub:http://github.com/3b1b/manim 动画精确到数学定义,不是拖关键帧的近似效果,做讲解视频、课件演示比通用剪辑软件对路得多。 想上手的话还有个 2020 年分出去的社区维护版,文档更全对新手更友好,README 里就有指路。 数学老师、做科普内容的、想给论文配个动图的,都值得看看。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

刷到 3Blue1Brown 的数学视频总会多看两眼,那些公式流畅变形、图形随讲解起舞,一直好奇是怎么做出来的。 答案就是作者自己写的动画引擎 manim,每一帧都由 Python 代码算出来,已斩获 92000+ Star! 写几行代码描述对象和变换,中间过程它负责平滑补全,图形渐变、坐标系旋转、公式逐项展开都行。 GitHub:http://github.com/3b1b/manim 动画精确到数学定义,不是拖关键帧的近似效果,做讲解视频、课件演示比通用剪辑软件对路得多。 想上手的话还有个 2020 年分出去的社区维护版,文档更全对新手更友好,README 里就有指路。 数学老师、做科普内容的、想给论文配个动图的,都值得看看。

背景
3Blue1Brown 是由 Grant Sanderson 创建的热门教育类 YouTube 频道,以直观的数学可视化讲解而闻名。Manim(Mathematical Animation Engine 的缩写)是 Sanderson 为生成该频道动画而编写的自定义 Python 库。与手动移动对象的传统动画软件不同,manim 允许用户编写代码来描述数学对象和变换,引擎会渲染出流畅的动画。该项目现已发展成一个由社区驱动的项目,拥有丰富的文档和示例。

9月3日 04:00在 X 打开#manim #animation #education #open-source #Python

127.0

LangChain 与 Nevermined AI 推出自主代理支付 Cookbook

LangChain 与 Nevermined AI 合作发布了一份新的 Cookbook,使 AI 代理能够在任务执行过程中自主支付服务费用,无需人工干预。该集成允许用户将信用卡或借记卡委托给代理,并设置预定义的消费限额,代理可以购买积分、自行充值并为其使用的工具付费。代理的每一笔购买都可在 LangSmith 中追踪,为代理支出提供可观测性。 这一集成填补了代理商务中的一个关键空白:让代理能够自主交易,同时保持用户控制和可审计性。通过将 Nevermined 的支付基础设施与 LangChain 的代理框架及 LangSmith 可观测性相结合,它降低了构建可按需购买 API、数据集或其他服务的代理的门槛。这可能会加速研究、数据处理和自动化工具使用等领域全自主工作流的开发。 该 Cookbook 演示了如何将卡片委托给代理并设置消费限额,使代理能够购买积分、自行充值并支付工具费用。Nevermined Pay 支持使用用户现有的信用卡或借记卡在用户定义的严格规则内进行真实购买。该集成适用于 LangChain 代理,并将所有购买记录为 LangSmith 中的追踪信息,以便监控和审计。公告中未提供支持的具体支付方式、费用结构或延迟等技术细节。

@LangChain原推文1 张图片New cookbook with @Nevermined_AI: ✅ Let your agents pay for what they need mid-task, no human required ✅ Delegate your card, and set limits ✅ Let your agent buy credits, top itself up, and pay for the tools it uses ✅ Every purchase, traceable in LangSmith Learn more: https://www.langchain.com/blog/agents-that-pay-how-nevermined-empowers-langchain-agents-to-buy-and-sell-services --- From twitter --- See what we cooked up: https://www.langchain.com/blog/agents-that-pay-how-nevermined-empowers-langchain-agents-to-buy-and-sell-services > 引用 @Nevermined_ai: 1/10 Agentic commerce has a missing layer. > Giving an AI agent permission to pay is not the same as knowing whether that payment was worth making. > That’s why we’re partnering with @LangChain. > > 🧵原推文媒体预览展开原推文收起原推文

@LangChain

New cookbook with @Nevermined_AI: ✅ Let your agents pay for what they need mid-task, no human required ✅ Delegate your card, and set limits ✅ Let your agent buy credits, top itself up, and pay for the tools it uses ✅ Every purchase, traceable in LangSmith Learn more: https://www.langchain.com/blog/agents-that-pay-how-nevermined-empowers-langchain-agents-to-buy-and-sell-services --- From twitter --- See what we cooked up: https://www.langchain.com/blog/agents-that-pay-how-nevermined-empowers-langchain-agents-to-buy-and-sell-services > 引用 @Nevermined_ai: 1/10 Agentic commerce has a missing layer. > Giving an AI agent permission to pay is not the same as knowing whether that payment was worth making. > That’s why we’re partnering with @LangChain. > > 🧵

背景
LangChain 是一个流行的开源框架,用于构建基于大语言模型的应用,包括可以调用工具和 API 的自主代理。Nevermined 是一家专为 AI 代理设计的支付基础设施提供商,使代理能够按照用户定义的消费规则进行购买。LangSmith 是 LangChain 的可观测性和评估平台,代理的每次操作都会记录为追踪信息,用于调试和监控。代理商务是指 AI 代理自主买卖数字服务的新兴领域,需要不同于传统人工发起交易的新支付协议。

9月3日 18:02在 X 打开#AI agents #LangChain #autonomous payments #tooling