8月11日2026 · 星期二

从 40 条抓取中筛选 12 条 · twitter × 8 账号 · 01:04 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. Claude AI 将黎曼猜想临界线零点比例下界提升至 67.2%10.0
  2. OpenAI 推出用于漏洞研究的 GPT-5.6-Cyber 模型9.0
  3. Kimi K2.5 参与者:AI 智能提升,harness 复杂度随之增长8.0
  4. Cursor人才主管揭秘打造顶尖技术团队的招聘策略8.0
  5. Anthropic 为 Claude 输出添加隐形水印和 C2PA 元数据8.0
  6. Qwen-MM-Plugins 将多模态模型转化为多模态智能体8.0
  7. Cloudflare 推出 Kitesurf:基于 Rust 的 AI 代理浏览器引擎,运行于 Workers8.0
  8. 微软开源 Skill Recorder:将屏幕录制转化为 AI 代理技能8.0
  9. Meta 开源 Muse Glimmer 30B 模型并预告 Muse Spark 1.28.0
  10. Anthropic Labs 团队通过内部狗粮测试驱动产品成功7.0
  11. LangChain 教程:用 Stagehand v4 和 Managed Deep Agents 构建网页浏览智能体7.0
  12. AI 可观测性与追踪在 RAG 系统中的重要性解析7.0
0110.0

Claude AI 将黎曼猜想临界线零点比例下界提升至 67.2%

Anthropic 披露,一个未公开的研究版 Claude 在与黎曼猜想相关的问题上取得了重大突破。它将黎曼 ζ 函数非平凡零点落在临界线上的已知比例下界从 41.6% 提升至 67.2%,实现了超过 25 个百分点的历史性单步跃升。该证明已由数学家验证,并在 Lean 证明助手中形式化。 这一结果表明,AI 能够在前沿数学研究中做出原创性、高影响力的贡献,而不仅仅是解决已有问题。67.2% 的界限是这一研究方向 80 年历史上最大的单次提升,超越了人类数十年的渐进式进展。这预示着数学研究方式可能发生转变,AI 将作为创造性合作者参与其中。 Claude 结合了 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 近年来的工作以及 Bombieri 在 2000 年的一篇论文。整个过程在 1.5 天内动用了 60 个子智能体、2400 条命令和数百个 Python 脚本。证明由数学家 Levent Alpöge、Ralph Furman、Brian Conrey 和 Dan Goldston 审阅,并用 Lean 编写了机器可验证的版本。Anthropic 指出,这种方法不太可能直接证明完整的黎曼猜想。

@dotey引用推文1 张图片Anthropic 今天宣布,一个未公开的研究版 Claude 在尝试证明黎曼猜想的过程中,虽然没能证明猜想本身,却在一个相关问题上取得了重大突破: 它把黎曼 ζ 函数的非平凡零点落在临界线上的已知比例下界,从 41.6% 提高到了 67.2%。 黎曼猜想是数学界最著名的未解难题之一,1859 年提出,至今 167 年无人能证明或推翻。它的核心主张是:黎曼 ζ 函数的所有非平凡零点都落在复平面上一条特定的竖直线上,数学家称之为“临界线”。 如果这个猜想成立,素数的分布就有了一种深层的规律性。这个问题列在克雷数学研究所的七大千禧年问题之中,悬赏 100 万美元。 既然全面证明太难,数学家们退而求其次: 能不能至少证明有多大比例的零点确实在这条线上? 这个方向上的进展,过去 80 年是这样的: - 1942 年 Selberg 首次证明有正比例的零点在线上,但比例很小; - 1974 年 Levinson 证明至少三分之一; - 1989 年 Conrey 推到五分之二; - 此后又经历了几代数学家的努力,到 2020 年 Pratt 等人才把这个数字推到 41.7%。 换句话说,从 33% 到 41.7%,人类花了将近 50 年。Claude 一步跳到 67.2%,跨度接近 26 个百分点,是这个问题历史上最大的一次单步提升。 Claude 的发现建立在前人的工作之上。它结合了 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 近年发表的一系列成果,以及数学家 Bombieri 在 2000 年的一篇论文。这些工作本身已经为突破铺好了路,而 Claude 找到了把它们拼在一起的方法。 Anthropic 的两位数学家 Levent Alpöge 和 Ralph Furman 审查验证了 Claude 的证明,外部专家 Brian Conrey 和 Dan Goldston 也在短时间内审阅了论文。Claude 还用 Lean(一种形式化证明语言)写出了可机器验证的证明。 过程本身和结果一样有故事。Anthropic 的一位员工 Jarred Sumner(不是数学家)在 Claude Code 中对 Claude 说了一句“认真试试黎曼猜想”,然后就把数学决策交给了模型。 Claude 先生成了 650 个想法,全部失败。被鼓励再试一次后,它花了一天半时间协调大约 60 个子智能体(subagent),运行了 2400 条命令,写了数百个 Python 脚本。这些子智能体之间分工明确:2 个负责核心数学思路,13 个为它们提供想法,30 个尝试但未能提出新思路,13 个做验证,2 个帮忙写论文。 整个过程中 Jarred 的参与基本限于给 Claude 打气,发的消息大多是“继续”和“相信自己”。 Anthropic 说,这种鼓励似乎帮助 Claude 克服了“我真的能在这种级别的问题上有所推进吗”的自我怀疑。 这已经是 Claude 今年第二次在数学领域搞出大新闻了。三周前,Anthropic 的数学家 Levent Alpöge 用 Claude Fable 5 找到了 Jacobian 猜想(Jacobian Conjecture)的反例,推翻了这个 87 年历史的代数几何猜想的一般形式。那次的反例简洁到人类数学家一天之内就能手动验证。 两次事件有一个共同点:Claude 做的不是解题,而是原创性的数学研究,是在数学家们几十年没能推进的前沿问题上找到了新路径。 Anthropic 也明确表示,Claude 使用的技术不太可能直接导向黎曼猜想的最终证明,但这个结果展示了 AI 模型在数学能力上的进步速度。 Anthropic 公布了 Claude 的完整论文、Lean 形式化证明、简明证明笔记,以及 Claude 自己描述思路演化过程的附录,都可以在 Anthropic 官网的研究页面找到。原推文媒体预览展开原推文收起原推文

@dotey

Anthropic 今天宣布,一个未公开的研究版 Claude 在尝试证明黎曼猜想的过程中,虽然没能证明猜想本身,却在一个相关问题上取得了重大突破: 它把黎曼 ζ 函数的非平凡零点落在临界线上的已知比例下界,从 41.6% 提高到了 67.2%。 黎曼猜想是数学界最著名的未解难题之一,1859 年提出,至今 167 年无人能证明或推翻。它的核心主张是:黎曼 ζ 函数的所有非平凡零点都落在复平面上一条特定的竖直线上,数学家称之为“临界线”。 如果这个猜想成立,素数的分布就有了一种深层的规律性。这个问题列在克雷数学研究所的七大千禧年问题之中,悬赏 100 万美元。 既然全面证明太难,数学家们退而求其次: 能不能至少证明有多大比例的零点确实在这条线上? 这个方向上的进展,过去 80 年是这样的: - 1942 年 Selberg 首次证明有正比例的零点在线上,但比例很小; - 1974 年 Levinson 证明至少三分之一; - 1989 年 Conrey 推到五分之二; - 此后又经历了几代数学家的努力,到 2020 年 Pratt 等人才把这个数字推到 41.7%。 换句话说,从 33% 到 41.7%,人类花了将近 50 年。Claude 一步跳到 67.2%,跨度接近 26 个百分点,是这个问题历史上最大的一次单步提升。 Claude 的发现建立在前人的工作之上。它结合了 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 近年发表的一系列成果,以及数学家 Bombieri 在 2000 年的一篇论文。这些工作本身已经为突破铺好了路,而 Claude 找到了把它们拼在一起的方法。 Anthropic 的两位数学家 Levent Alpöge 和 Ralph Furman 审查验证了 Claude 的证明,外部专家 Brian Conrey 和 Dan Goldston 也在短时间内审阅了论文。Claude 还用 Lean(一种形式化证明语言)写出了可机器验证的证明。 过程本身和结果一样有故事。Anthropic 的一位员工 Jarred Sumner(不是数学家)在 Claude Code 中对 Claude 说了一句“认真试试黎曼猜想”,然后就把数学决策交给了模型。 Claude 先生成了 650 个想法,全部失败。被鼓励再试一次后,它花了一天半时间协调大约 60 个子智能体(subagent),运行了 2400 条命令,写了数百个 Python 脚本。这些子智能体之间分工明确:2 个负责核心数学思路,13 个为它们提供想法,30 个尝试但未能提出新思路,13 个做验证,2 个帮忙写论文。 整个过程中 Jarred 的参与基本限于给 Claude 打气,发的消息大多是“继续”和“相信自己”。 Anthropic 说,这种鼓励似乎帮助 Claude 克服了“我真的能在这种级别的问题上有所推进吗”的自我怀疑。 这已经是 Claude 今年第二次在数学领域搞出大新闻了。三周前,Anthropic 的数学家 Levent Alpöge 用 Claude Fable 5 找到了 Jacobian 猜想(Jacobian Conjecture)的反例,推翻了这个 87 年历史的代数几何猜想的一般形式。那次的反例简洁到人类数学家一天之内就能手动验证。 两次事件有一个共同点:Claude 做的不是解题,而是原创性的数学研究,是在数学家们几十年没能推进的前沿问题上找到了新路径。 Anthropic 也明确表示,Claude 使用的技术不太可能直接导向黎曼猜想的最终证明,但这个结果展示了 AI 模型在数学能力上的进步速度。 Anthropic 公布了 Claude 的完整论文、Lean 形式化证明、简明证明笔记,以及 Claude 自己描述思路演化过程的附录,都可以在 Anthropic 官网的研究页面找到。

@jarredsumner

8 days ago, while jogging, I asked Claude to solve the Riemann Hypothesis It didn’t. 1.5 days later, it proved >= 67% of the zeros are on the line (prev: 41.6%) Still not sure what that means, but some analytic number theorists seem excited https://www.anthropic.com/research/riemann-zeta

背景
黎曼猜想于 1859 年提出,声称黎曼 ζ 函数的所有非平凡零点都位于临界线 Re(s)=1/2 上。它是七大千禧年难题之一。由于完整证明难以实现,数学家们转而寻求临界线上零点比例的下界。关键里程碑包括 Selberg(1942 年,正比例)、Levinson(1974 年,>1/3)、Conrey(1989 年,>2/5)和 Pratt 等人(2020 年,41.7%)。Lean 是一种允许对数学证明进行形式化验证的证明助手。

8月10日 19:48在 X 打开#AI #mathematics #Riemann hypothesis #Claude #breakthrough

029.0

OpenAI 推出用于漏洞研究的 GPT-5.6-Cyber 模型

OpenAI 发布了专为网络安全设计的 GPT-5.6-Cyber 模型,并扩展了 Daybreak 计划,新增 Blue 和 Red 两个访问层级。该模型已用于真实世界的漏洞研究,发现了 Chrome V8 引擎等开源软件中此前未知的漏洞。访问权限仅限于经过批准的防御者,并对高风险工作施加额外控制。 此举在攻击者将类似技术武器化之前,将先进 AI 能力交到防御者手中,可能缩小网络防御的窗口期。它标志着向主动式 AI 辅助安全的转变,影响漏洞研究人员、安全团队和更广泛的软件供应链。受限访问模式也为在敏感领域负责任地部署强大 AI 树立了先例。 GPT-5.6-Cyber 通过 Daybreak Red 层级提供,定价为每百万输出 token 12.50 美元。Daybreak Blue 提供 GPT-5.6-Sol 等通用模型并配有定制化防护措施,而 Red 则提供专门的网络安全模型。测试中,GPT-5.6-Sol 仅响应了 1.5% 的恶意请求,Blue 版本仅响应 2%,显示出强大的安全措施。

@OpenAI串推 2 条2 段 · 1 张图片We've used GPT-5.6-Cyber extensively in real-world vulnerability research, including work that uncovered previously unknown vulnerabilities in popular open-source software like Chrome’s v8 engine.原推文媒体预览展开原推文收起原推文

@OpenAI串推 2 条

We've used GPT-5.6-Cyber extensively in real-world vulnerability research, including work that uncovered previously unknown vulnerabilities in popular open-source software like Chrome’s v8 engine.

Advanced capabilities require strong safeguards. That’s why access is limited to approved defenders, with additional controls and monitoring for higher-risk cybersecurity work. https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows

背景
OpenAI 的 Daybreak 计划旨在通过向可信合作伙伴提供 AI 工具来加速网络防御。Chrome 的 V8 是 Google Chrome 和 Node.js 中使用的 JavaScript 引擎,是 Web 安全的关键组件。漏洞研究涉及在软件缺陷被利用之前发现并报告它们。“网络防御窗口”指防御者在攻击者利用漏洞之前进行修补的时间。

8月10日 17:16在 X 打开#AI #Cybersecurity #OpenAI #GPT-5.6-Cyber #Vulnerability Research

038.0

Kimi K2.5 参与者:AI 智能提升,harness 复杂度随之增长

一位参与 Kimi K2.5 训练的从业者指出,随着 AI 模型智能的提升,harness(模型外围的脚手架代码)并非变得更简单,而是愈发复杂。他们提到,并行工具调用、子代理、代理集群等功能的加入是为了解锁新能力,这种复杂化是 AI 系统演进的必经阶段。 这一观点挑战了“更聪明的模型会消除复杂脚手架”的普遍假设。它表明模型智能与 harness 复杂度之间存在动态的协同演化关系,这对智能体 AI 系统的设计具有深远影响。类比人类进化,意味着随着 AI 进步,其与世界的交互将更加丰富和复杂,可能重塑软件乃至社会。 作者曾参与 Kimi K2.5 和 Kimi CLI 的开发,观察到随着模型进步,他们原本计划移除子代理和并行工具调用等功能,但随后又出现了主动上下文回退等新能力。他们引用“阴阳”比喻,并预测 harness 最终将与人类的社会基础设施融合,导致所有软件被重新构想。

@istdrc@dotey 转推你可能没理解 harness 实际上是什么 如果只是说那点 system prompt 和 tool,那显然模型可以学会它们,从此之后只需要一个 tool list + tool 实现就够,而进一步地,当模型再强大一点,我们只需要一个 bash tool,我参与过 Kimi K2.5 模型训练过程,以及从空的 system prompt、toolset 和 loop 开始写 harness,我当然知道人们说的 harness 训进模型是什么意思 但你观察 harness 的发展史和这个词本身的出现,你就会发现,随着模型智能的提升,harness 是在不断变复杂的,parallel tool call、subagent、agent swarm、agent teams、handoff、pro-active compaction、channel、cross-session communication,你以为是模型都可以学会,实际上是 harness 变复杂了模型才可能学会 所有这些确实都可以进一步随着模型加强而去掉,比如我在 Kimi CLI 时就准备去掉 subagent,换成直接 bash 调用(pi 就是这么做的),去掉 parallel tool call,换成 tool call script;但与此同时,更强的智能解锁了更复杂的与世界的互动,比如进一步可以引入主动 context rewind 这是一个此消彼长的过程,就像这个“阴阳”比喻 https://x.com/nocommas/status/2086568454434537710 观察动物乃至人类的进化你就会发现是一样的,随着智能水平的提高,人与世界的交互方式是越来越复杂的:当人相比猿更聪明的大脑被选择后,带来的并不是不需要用树枝计数,而是复杂的语言文字;同样,当人类社会作为群体智能的水平提高的时候,人们并不是取缔了纸,而是发明了计算机和互联网 终局来看,harness 会逐渐和人类原来为“仅有的一种智能”所发展的社会基础设施合并,人类文明的一切都可以重新做一遍(显然我们已经观察到所有 SaaS 都可以重新做一遍,很快会看到更多,当然不只是计算机软件) 不要只看到模型训练那一点局部,看看人类学吧展开原推文收起原推文

@dotey 转推了

@istdrc

你可能没理解 harness 实际上是什么 如果只是说那点 system prompt 和 tool,那显然模型可以学会它们,从此之后只需要一个 tool list + tool 实现就够,而进一步地,当模型再强大一点,我们只需要一个 bash tool,我参与过 Kimi K2.5 模型训练过程,以及从空的 system prompt、toolset 和 loop 开始写 harness,我当然知道人们说的 harness 训进模型是什么意思 但你观察 harness 的发展史和这个词本身的出现,你就会发现,随着模型智能的提升,harness 是在不断变复杂的,parallel tool call、subagent、agent swarm、agent teams、handoff、pro-active compaction、channel、cross-session communication,你以为是模型都可以学会,实际上是 harness 变复杂了模型才可能学会 所有这些确实都可以进一步随着模型加强而去掉,比如我在 Kimi CLI 时就准备去掉 subagent,换成直接 bash 调用(pi 就是这么做的),去掉 parallel tool call,换成 tool call script;但与此同时,更强的智能解锁了更复杂的与世界的互动,比如进一步可以引入主动 context rewind 这是一个此消彼长的过程,就像这个“阴阳”比喻 https://x.com/nocommas/status/2086568454434537710 观察动物乃至人类的进化你就会发现是一样的,随着智能水平的提高,人与世界的交互方式是越来越复杂的:当人相比猿更聪明的大脑被选择后,带来的并不是不需要用树枝计数,而是复杂的语言文字;同样,当人类社会作为群体智能的水平提高的时候,人们并不是取缔了纸,而是发明了计算机和互联网 终局来看,harness 会逐渐和人类原来为“仅有的一种智能”所发展的社会基础设施合并,人类文明的一切都可以重新做一遍(显然我们已经观察到所有 SaaS 都可以重新做一遍,很快会看到更多,当然不只是计算机软件) 不要只看到模型训练那一点局部,看看人类学吧

@NoCommas

I was able to comment. The truth about Pi’s article actually just said thin prompt (your context) and thick harness Harness is about capturing the invariant structural mechanism, the yang for yin(model),the Apollo for the Dionysus, the *Antigma* for the Enigma

背景
在 AI 智能体中,“harness”(或脚手架)是包裹模型的代码,负责工具执行、记忆、上下文管理和验证,让模型专注于推理。随着模型能力增强,有人认为 harness 可以简化,但这条推文认为,更高的智能会催生更复杂的交互,从而需要更复杂的 harness。Kimi K2.5 是月之暗面推出的视觉智能体模型,基于 15 万亿 token 训练。
社区讨论
该推文是一个关于 harness 本质的讨论串的一部分,另一位用户将 harness 描述为与模型互补的“不变结构机制”。作者基于实践经验的细致观点引发了关于智能体脚手架演变角色的思考和互动。

8月10日 07:12在 X 打开#AI agents #harness #Kimi K2.5 #agent scaffolding #model intelligence

048.0

Cursor人才主管揭秘打造顶尖技术团队的招聘策略

Cursor人才主管Adam Ward分享了关于前线部署工程师(FDE)需求激增的见解,这类人才兼具深厚技术功底与面向客户的能力。他批评传统招聘漏斗是导致团队平庸的“死亡漏斗”,并主张将每次招聘都视为高管猎聘。Ward还强调了接受offer后的跟进、实战考察以及精心绘制候选人图谱的重要性。 这些见解反映了科技行业招聘向更具战略性、高接触流程的转变,以在激烈竞争中争夺顶尖人才。对FDE的重视表明,市场越来越需要能够连接产品与销售、直接影响业务成果的工程师。采用这些实践有助于初创公司和科技企业打造高密度人才团队,避免传统招聘的陷阱。 Ward将FDE热潮比作当年的移动端工程师招聘潮,但指出现在变化发生在几天或几周内。他建议用具体的问题取代泛泛的推荐询问,以获得精准推荐。Cursor为每位核心候选人设立专属Slack频道并召开每日站会,并将接受offer后的时期视为一场战役,包括入职前聚餐和寄送笔记本电脑。实战考察被认为是预测成功的最佳指标,Cursor曾在取消后因团队信心下降而重新启用。

@dotey引用推文1 个视频转译自 Lenny Rachitsky 我从 Cursor 人才主管 Adam Ward (@wardadamp) 那里学到的最大收获: 1. 前线部署工程师 (FDE,forward deployed engineer) 是目前科技界最抢手的职位。 他们必须具备深厚的技术功底,同时又能和销售团队打好配合,在公司高管面前从容自信。他们要把复杂的产品转化为实际的商业结果,帮助客户优化 AI 账单,而不是仅仅在“最大化消耗 Token” 上做文章。 Adam 将这股热潮与当年的移动端工程师招聘潮相提并论——只不过,当年那股热潮持续演进了两年,而“现在,一切都发生在几天或几周之内”。 2. 传统的招聘漏斗,被 Adam 戏称为“死亡漏斗” (funnel of doom),其实是个专门打造平庸团队的机制。 标准的招聘漏斗是这样的:联系 100 个人,20 个回复,每一轮面试淘汰掉一批,最后录用剩下的人。 但这套玩法建立在一个漏洞百出的前提上:最先回复你的那 100 个人,根本不是行业里最顶尖的 20%,他们可能只是那天碰巧心情不好、想换工作而已。等到候选人走到漏斗最底端时,你其实已经是在一个“矮子里拔将军”的池子里挑人了。 即便你的面试流程再严苛,最终拼凑出的也只是个平庸的团队。 3. 破局之道在于:把每一次招聘都当成“高管猎聘” (executive search) 来对待。 这意味着你需要严谨地界定岗位需求 (rigorous scoping)——对这个特定岗位而言,什么是“优秀”? 这意味着你要精心绘制候选人图谱 (deliberate candidate mapping)——全世界最适合这个岗位的 50 个人到底是谁? 这还意味着你要穷追不舍 (relentless pursuit)——锁定这 50 个人,死死咬住不放。这种视角的转变,意味着你要从确立“卓越支柱” (pillar of excellence) 开始招人,而不是一开始就撒一张盲目的大网。 4. 现在的“新危险区”出现在候选人签下 Offer 之后。 候选人接了 Offer 又毁约的趋势正在上升,而且资深人才从签约到入职之间往往有几周的空档期。因此,Cursor 把“接受 Offer 后”的这段时间当成一场专门的战役来打。 他们会组织新入职的员工一起聚餐,在入职第一天前就把笔记本电脑寄过去,在任何人正式打卡上班前,就让他们感受到社区的归属感。这不仅能确保大家准时报到,还能让他们在入职后更快地进入工作状态。 5. 实战考察 (work trials) 是预测一个人能否胜任工作的最佳指标。 研究早就反复证明了这一点,但目前行业的默认面试形式,依然是隔着桌子进行一轮又一轮的一对一聊天。Cursor 则会安排长时间的现场实战体验,让候选人与团队肩并肩,共同推进一个真实的(或者高度还原的)项目。 这种形式能同时传递出三层信号:技术能力、核心价值观以及协作默契度,同时也给了候选人自己做决定、双向奔赴的数据依据。Cursor 曾经做过一个实验,试着取消实战考察,结果团队对招进来的人信心大跌。于是,他们果断把实战考察加了回来。 6. 跑去问你的人脉圈“你认识的最牛的工程师是谁?”——这是一个陷阱。 相反,你应该根据你界定的岗位需求,抛出极其具体的问题:“在你合作过的所有产品工程师里,谁和设计师配合得最默契?”或者“谁能把一个技术框架转化成产品,而且比你见过的任何人都做得好?”——因为具体的提示词 (prompts) 才能让人脑海中迅速跳出确切的名字。 当有几个你信任的人,都不约而同地提到同一个人时(“Lenny 提到了他,Sally 也提到了他”),你就可以通过这种交叉验证,锁定那个你要放进“全球 50 强候选人”名单里的目标了。 7. 明确岗位需求 (scoping the role) 是大多数招聘流程中最被忽视、投入最少的一步。 “我一看到牛人就能认出来”——这绝对是个错觉。如果你不在前期花时间去明确、并给这个岗位在特定公司所需的技能、经验和特质排个序 (stack-rank),你就根本不会有针对性的招聘策略,没法给出打动人的说辞,也设计不出真正有效的评估方法。后续所有的流程,其实都源于这最开始的一步。 另外,要抵制住“看名企光环”的捷径诱惑:在合适的时间、在某家大厂的优秀团队待过,这仅仅是“有可能”代表他很优秀;如果你直接照搬别人的用人标准,那你其实就是在给一个你本就觉得千疮百孔的招聘流程“抬轿子”。 8. 当顶尖候选人告诉你“现在时机不对”时,试着降低你的要求:“我不是要面试你——我只是希望能有下一次交流。” Adam 会默默埋下种子——比如喝杯咖啡、邀请参观办公室、或者把他介绍给一位对他的工作极其着迷的团队成员——这些种子会在几周、几个月甚至几年后开花结果。因为如果你选择了沉默,想着“秋天再联系”,那最好的结果也就是在没人抢走他的情况下,你碰巧捡了个漏。 在 Cursor,寻找一个热情的引荐人,所花费的心力几乎和写一封招募邮件一样多,因为一旦别人无视了你的第一条消息,再无视你的第二条、第三条就会变得越来越容易。 Cursor 还会巧妙地利用“主场优势” (home games),把接触的重点放在一起吃顿饭上——“这既能让人卸下防备,又能拉近关系”——以及邀请对方参观办公室,刻意营造出那种大学校园导览时让人觉得“这里就像家一样”的直觉。 9. 促成签约 (closing) 是一项团队运动,而且从第一次对话就开始了。 当 Cursor 正在跟进一位高素质的候选人时,团队会针对这个人召开每日站会 (daily standups):我们对他的动机有了什么新了解?他提出了哪些顾虑?团队里谁最适合去解答这些疑虑? 每一位核心候选人都会有一个专属的 Slack 频道。所谓的“促单签约”,不应该感觉像是一次生硬的销售推销,而应该是整个流程中持续为你解答疑虑后,水到渠成的自然结果。 10. 用心是不花钱的,但它却是招聘中最大的“不公平优势” (unfair advantage)。 Adam 说,纵观整个招聘领域的历史,决定候选人满意度得分的最关键因素,就是让他们感觉到这家公司是真心实意想要你。 因此,Cursor 会精心设计每一个接触点 (touchpoints):谁来迎接候选人,谁在午餐时坐在他们旁边,哪位面试官能和他们聊聊小众爱好——这一切都是精心挑选的,绝不是谁日程表有空就拉谁来凑数。 要让这种“用心”可持续,你需要转变一下思维:你是在为这个岗位招那“唯一的一个人”,而不是在招 10 个人。“不要把精力分散在 10 个人身上;把所有的专注都留给那唯一的 1 个。”原推文媒体预览展开原推文收起原推文

@dotey

转译自 Lenny Rachitsky 我从 Cursor 人才主管 Adam Ward (@wardadamp) 那里学到的最大收获: 1. 前线部署工程师 (FDE,forward deployed engineer) 是目前科技界最抢手的职位。 他们必须具备深厚的技术功底,同时又能和销售团队打好配合,在公司高管面前从容自信。他们要把复杂的产品转化为实际的商业结果,帮助客户优化 AI 账单,而不是仅仅在“最大化消耗 Token” 上做文章。 Adam 将这股热潮与当年的移动端工程师招聘潮相提并论——只不过,当年那股热潮持续演进了两年,而“现在,一切都发生在几天或几周之内”。 2. 传统的招聘漏斗,被 Adam 戏称为“死亡漏斗” (funnel of doom),其实是个专门打造平庸团队的机制。 标准的招聘漏斗是这样的:联系 100 个人,20 个回复,每一轮面试淘汰掉一批,最后录用剩下的人。 但这套玩法建立在一个漏洞百出的前提上:最先回复你的那 100 个人,根本不是行业里最顶尖的 20%,他们可能只是那天碰巧心情不好、想换工作而已。等到候选人走到漏斗最底端时,你其实已经是在一个“矮子里拔将军”的池子里挑人了。 即便你的面试流程再严苛,最终拼凑出的也只是个平庸的团队。 3. 破局之道在于:把每一次招聘都当成“高管猎聘” (executive search) 来对待。 这意味着你需要严谨地界定岗位需求 (rigorous scoping)——对这个特定岗位而言,什么是“优秀”? 这意味着你要精心绘制候选人图谱 (deliberate candidate mapping)——全世界最适合这个岗位的 50 个人到底是谁? 这还意味着你要穷追不舍 (relentless pursuit)——锁定这 50 个人,死死咬住不放。这种视角的转变,意味着你要从确立“卓越支柱” (pillar of excellence) 开始招人,而不是一开始就撒一张盲目的大网。 4. 现在的“新危险区”出现在候选人签下 Offer 之后。 候选人接了 Offer 又毁约的趋势正在上升,而且资深人才从签约到入职之间往往有几周的空档期。因此,Cursor 把“接受 Offer 后”的这段时间当成一场专门的战役来打。 他们会组织新入职的员工一起聚餐,在入职第一天前就把笔记本电脑寄过去,在任何人正式打卡上班前,就让他们感受到社区的归属感。这不仅能确保大家准时报到,还能让他们在入职后更快地进入工作状态。 5. 实战考察 (work trials) 是预测一个人能否胜任工作的最佳指标。 研究早就反复证明了这一点,但目前行业的默认面试形式,依然是隔着桌子进行一轮又一轮的一对一聊天。Cursor 则会安排长时间的现场实战体验,让候选人与团队肩并肩,共同推进一个真实的(或者高度还原的)项目。 这种形式能同时传递出三层信号:技术能力、核心价值观以及协作默契度,同时也给了候选人自己做决定、双向奔赴的数据依据。Cursor 曾经做过一个实验,试着取消实战考察,结果团队对招进来的人信心大跌。于是,他们果断把实战考察加了回来。 6. 跑去问你的人脉圈“你认识的最牛的工程师是谁?”——这是一个陷阱。 相反,你应该根据你界定的岗位需求,抛出极其具体的问题:“在你合作过的所有产品工程师里,谁和设计师配合得最默契?”或者“谁能把一个技术框架转化成产品,而且比你见过的任何人都做得好?”——因为具体的提示词 (prompts) 才能让人脑海中迅速跳出确切的名字。 当有几个你信任的人,都不约而同地提到同一个人时(“Lenny 提到了他,Sally 也提到了他”),你就可以通过这种交叉验证,锁定那个你要放进“全球 50 强候选人”名单里的目标了。 7. 明确岗位需求 (scoping the role) 是大多数招聘流程中最被忽视、投入最少的一步。 “我一看到牛人就能认出来”——这绝对是个错觉。如果你不在前期花时间去明确、并给这个岗位在特定公司所需的技能、经验和特质排个序 (stack-rank),你就根本不会有针对性的招聘策略,没法给出打动人的说辞,也设计不出真正有效的评估方法。后续所有的流程,其实都源于这最开始的一步。 另外,要抵制住“看名企光环”的捷径诱惑:在合适的时间、在某家大厂的优秀团队待过,这仅仅是“有可能”代表他很优秀;如果你直接照搬别人的用人标准,那你其实就是在给一个你本就觉得千疮百孔的招聘流程“抬轿子”。 8. 当顶尖候选人告诉你“现在时机不对”时,试着降低你的要求:“我不是要面试你——我只是希望能有下一次交流。” Adam 会默默埋下种子——比如喝杯咖啡、邀请参观办公室、或者把他介绍给一位对他的工作极其着迷的团队成员——这些种子会在几周、几个月甚至几年后开花结果。因为如果你选择了沉默,想着“秋天再联系”,那最好的结果也就是在没人抢走他的情况下,你碰巧捡了个漏。 在 Cursor,寻找一个热情的引荐人,所花费的心力几乎和写一封招募邮件一样多,因为一旦别人无视了你的第一条消息,再无视你的第二条、第三条就会变得越来越容易。 Cursor 还会巧妙地利用“主场优势” (home games),把接触的重点放在一起吃顿饭上——“这既能让人卸下防备,又能拉近关系”——以及邀请对方参观办公室,刻意营造出那种大学校园导览时让人觉得“这里就像家一样”的直觉。 9. 促成签约 (closing) 是一项团队运动,而且从第一次对话就开始了。 当 Cursor 正在跟进一位高素质的候选人时,团队会针对这个人召开每日站会 (daily standups):我们对他的动机有了什么新了解?他提出了哪些顾虑?团队里谁最适合去解答这些疑虑? 每一位核心候选人都会有一个专属的 Slack 频道。所谓的“促单签约”,不应该感觉像是一次生硬的销售推销,而应该是整个流程中持续为你解答疑虑后,水到渠成的自然结果。 10. 用心是不花钱的,但它却是招聘中最大的“不公平优势” (unfair advantage)。 Adam 说,纵观整个招聘领域的历史,决定候选人满意度得分的最关键因素,就是让他们感觉到这家公司是真心实意想要你。 因此,Cursor 会精心设计每一个接触点 (touchpoints):谁来迎接候选人,谁在午餐时坐在他们旁边,哪位面试官能和他们聊聊小众爱好——这一切都是精心挑选的,绝不是谁日程表有空就拉谁来凑数。 要让这种“用心”可持续,你需要转变一下思维:你是在为这个岗位招那“唯一的一个人”,而不是在招 10 个人。“不要把精力分散在 10 个人身上;把所有的专注都留给那唯一的 1 个。”

@lennysan

Cursor has spent its entire existence competing with every major AI lab and incumbent in the toughest market in tech—and has continued to win. So much so that @elonmusk bought them for $60 billion to help SpaceX win the AI race. They've done this by building one of the most talent-dense teams in history. Adam Ward (@wardadamp) is Head of Talent at @Cursor_AI—who acquired his legendary recruiting firm after he spent 20+ years building the most elite teams in tech—and in our conversation he shares the entire playbook for building high talent-density teams. We discuss: 🔸 Why the traditional recruiting funnel—the "funnel of doom"—guarantees mediocre hiring 🔸 Adam's three-step playbook for hiring the top 1% 🔸 The rise of the forward-deployed engineer 🔸 Today's "tale of two cities" talent market 🔸 The biggest mistake founders make with their first recruiting hire 🔸 The worst question you can ask when sourcing talent (you've definitely asked it) Watch the full episode right here 👇

背景
前线部署工程师直接与客户合作,实施和优化复杂技术系统,融合了软件开发与客户成功。高管猎聘是一种通常用于高级职位的定向招聘方法,包括严谨的岗位界定、候选人图谱绘制和持续跟进。传统招聘漏斗依赖主动申请者和逐轮筛选,可能过滤掉顶尖的被动候选人。Cursor是一家以AI驱动代码编辑器闻名的公司,以团队高度精英化著称,近期被Elon Musk以600亿美元收购。

8月10日 22:04在 X 打开#hiring #tech talent #forward deployed engineers #startups #talent acquisition

058.0

Anthropic 为 Claude 输出添加隐形水印和 C2PA 元数据

Anthropic 已开始在所有新 Claude 模型的输出中嵌入隐形文本水印和符合 C2PA 标准的数字签名元数据,自 2026 年 8 月 2 日起生效。水印在文本被复制粘贴后依然存在,元数据则附加到生成的 SVG、PNG 和 JPG 等文件中。此次部署覆盖全球所有 Claude 产品,包括 API、网页版和云平台。 这使得 Anthropic 成为首家大规模部署文本水印的主流 AI 实验室,此举是为了遵守欧盟 AI 法案第 50 条的透明度要求。它为 AI 生成文本的内容溯源设立了先例,可能影响行业标准,并帮助用户识别 AI 生成的内容。此举也可能促使其他 AI 提供商采取类似措施。 文本水印直接嵌入文本中,而非作为元数据,可经受一定程度的编辑,但大量改写或文本过短时可能丢失。检测仅表明内容可能经过 Claude 处理,不确认作者身份。文件元数据遵循 C2PA 开放标准,OpenAI 和 Google 已在图像生成中使用。对于 8 月 2 日前发布的 Claude 模型,Anthropic 仍在补充标记功能,尚未公布时间表。

@dotey原推文1 张图片Anthropic 宣布将给 Claude 的输出内容加上机器可读的标记,包括文本中嵌入的隐形水印,以及生成文件中附加的数字签名元数据。8 月 2 日起(也就是上周),所有新发布的 Claude 模型已经开始执行这套标记机制。 这是 Anthropic 为遵守欧盟 AI 法案第 50 条签署的透明度行为准则。但执行范围不限于欧盟,全球所有使用 Claude 的地方都会生效。 具体来说有两层标记。 第一层是文本水印:Claude 生成文字时,会在文本中织入人眼不可见的水印,不影响阅读体验和内容质量。这个水印的特点是“跟着文字走”,你把 Claude 写的一段话复制粘贴到邮件、文档或博客里,水印依然在,一定程度的编辑修改后也可能保留。 第二层是文件元数据:Claude 生成 SVG、PNG、JPG 等文件时,会附加符合 C2PA 标准的签名元数据。C2PA 是 Adobe、微软、Google 等公司共同推动的内容溯源开放协议,OpenAI 和 Google 的图像生成工具已经在用。 覆盖面很广。API、Claude 官网、Claude Code、Claude Cowork、Claude Tag,所有产品线都适用。通过 AWS、Google Cloud 或 Microsoft Foundry 调用 Claude 时,文本水印同样生效,但文件元数据取决于各云平台的功能支持。 在此之前,Claude 一直没有公开部署过文本水印。OpenAI 此前开发过文本水印方案,但出于各种考虑一直没上线。Anthropic 这次直接在文本层面落地水印,算是 AI 大模型厂商中走得比较靠前的一步。 对于用 Claude 写东西的人来说,一个直接的影响是:你用 Claude 起草的邮件、报告、文章,里面都会携带可被机器检测的水印。Anthropic 表示正在开发配套的检测工具,未来第三方也能检测。 不过限制也很实际。检测到水印只能说明内容“可能经过 Claude 处理”,不能确认 Claude 是原始作者,因为很多人用它润色、翻译、总结已有内容。反过来也一样,检测不到水印不代表内容不是 AI 写的,文本被大量改写后水印会消失,太短的文本信号不够可靠,文件经过格式转换或截图也会丢失元数据。 8 月 2 日之前发布的现有 Claude 模型,Anthropic 正在补充标记功能,具体时间表还没公布。如果你基于 Claude API 构建产品,Anthropic 建议你独立评估欧盟 AI 法案第 50 条对自己的合规要求。 相关文档:https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content --- From twitter --- bruh, you’re like a dude wearing full camo in downtown nyc. you are the watermark. that’s the load-bearing part and is worth sitting with. > 引用 @M1Astra: Anthropic says new Claude models will embed invisible watermarks in all generated text, everywhere Claude is offered. > > The watermark is part of the text, it isn't metadata: "it will travel with the text when it's copied and pasted elsewhere, and may persist through some editing." > > This starts with models launched on or after August 2, 2026, under an EU AI Act code Anthropic signed. Anthropic is still working on adding it to current models. The rollout is worldwide.原推文媒体预览展开原推文收起原推文

@dotey

Anthropic 宣布将给 Claude 的输出内容加上机器可读的标记,包括文本中嵌入的隐形水印,以及生成文件中附加的数字签名元数据。8 月 2 日起(也就是上周),所有新发布的 Claude 模型已经开始执行这套标记机制。 这是 Anthropic 为遵守欧盟 AI 法案第 50 条签署的透明度行为准则。但执行范围不限于欧盟,全球所有使用 Claude 的地方都会生效。 具体来说有两层标记。 第一层是文本水印:Claude 生成文字时,会在文本中织入人眼不可见的水印,不影响阅读体验和内容质量。这个水印的特点是“跟着文字走”,你把 Claude 写的一段话复制粘贴到邮件、文档或博客里,水印依然在,一定程度的编辑修改后也可能保留。 第二层是文件元数据:Claude 生成 SVG、PNG、JPG 等文件时,会附加符合 C2PA 标准的签名元数据。C2PA 是 Adobe、微软、Google 等公司共同推动的内容溯源开放协议,OpenAI 和 Google 的图像生成工具已经在用。 覆盖面很广。API、Claude 官网、Claude Code、Claude Cowork、Claude Tag,所有产品线都适用。通过 AWS、Google Cloud 或 Microsoft Foundry 调用 Claude 时,文本水印同样生效,但文件元数据取决于各云平台的功能支持。 在此之前,Claude 一直没有公开部署过文本水印。OpenAI 此前开发过文本水印方案,但出于各种考虑一直没上线。Anthropic 这次直接在文本层面落地水印,算是 AI 大模型厂商中走得比较靠前的一步。 对于用 Claude 写东西的人来说,一个直接的影响是:你用 Claude 起草的邮件、报告、文章,里面都会携带可被机器检测的水印。Anthropic 表示正在开发配套的检测工具,未来第三方也能检测。 不过限制也很实际。检测到水印只能说明内容“可能经过 Claude 处理”,不能确认 Claude 是原始作者,因为很多人用它润色、翻译、总结已有内容。反过来也一样,检测不到水印不代表内容不是 AI 写的,文本被大量改写后水印会消失,太短的文本信号不够可靠,文件经过格式转换或截图也会丢失元数据。 8 月 2 日之前发布的现有 Claude 模型,Anthropic 正在补充标记功能,具体时间表还没公布。如果你基于 Claude API 构建产品,Anthropic 建议你独立评估欧盟 AI 法案第 50 条对自己的合规要求。 相关文档:https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content --- From twitter --- bruh, you’re like a dude wearing full camo in downtown nyc. you are the watermark. that’s the load-bearing part and is worth sitting with. > 引用 @M1Astra: Anthropic says new Claude models will embed invisible watermarks in all generated text, everywhere Claude is offered. > > The watermark is part of the text, it isn't metadata: "it will travel with the text when it's copied and pasted elsewhere, and may persist through some editing." > > This starts with models launched on or after August 2, 2026, under an EU AI Act code Anthropic signed. Anthropic is still working on adding it to current models. The rollout is worldwide.

背景
欧盟 AI 法案第 50 条要求某些 AI 系统的提供商在用户与 AI 交互或内容为 AI 生成时告知用户。C2PA 标准由 Adobe、微软、Google 等共同开发,提供了一种为数字内容附加溯源元数据的方法。文本水印将隐藏模式嵌入 AI 生成的文本中以便检测,但其鲁棒性和可靠性存在局限。
社区讨论
有评论者幽默地指出,使用 AI 生成文本时用户自己就成了水印,凸显了标记常被整合进人类工作内容的讽刺意味。另一人强调水印作为文本一部分而非仅元数据的重要性,因为它会随复制内容一起传播。

8月10日 21:33在 X 打开#AI #Anthropic #watermarking #content provenance #EU AI Act

068.0

Qwen-MM-Plugins 将多模态模型转化为多模态智能体

阿里巴巴通义千问团队发布了 Qwen-MM-Plugins,一个开源代码库,将多模态能力打包为可安装的技能,供现有智能体框架使用。它使智能体能够原生处理图像、视频、文档和 3D/CAD 数据。该系统与六种主流智能体框架集成,无需重新开发底层工具。 这弥合了强大的多模态模型与实际智能体应用之间的鸿沟,使开发者能够轻松为其 AI 智能体添加视觉、视频编辑和 3D 理解能力。它加速了多模态智能体在设计、媒体和工程等行业的应用。通过支持多种智能体框架,它促进了开放生态并减少了供应商锁定。 Qwen-MM-Plugins 使用各框架的原生安装方式,并写入一个共享配置文件(~/.qwen-mm-plugins/config)。它提供模块化的多模态技能和 MCP 服务器,支持 Open WebUI、Claude Code 和 Cline 等客户端的安装。该代码库已在 GitHub 上开源,但尚未披露具体的性能基准或定价。

@Alibaba_Qwen原推文1 个视频👀 Seeing is just the beginning. With Qwen-MM-Plugins, turn your favorite agent harness multimodal-native — read images, videos & documents, edit videos, work with 3D/CAD, and more. From multimodal models → multimodal agents. 🚀 Watch it in action: https://github.com/QwenLM/Qwen-MM-Plugins原推文媒体预览展开原推文收起原推文

@Alibaba_Qwen

👀 Seeing is just the beginning. With Qwen-MM-Plugins, turn your favorite agent harness multimodal-native — read images, videos & documents, edit videos, work with 3D/CAD, and more. From multimodal models → multimodal agents. 🚀 Watch it in action: https://github.com/QwenLM/Qwen-MM-Plugins

背景
多模态 AI 模型能够理解并生成文本、图像、音频和视频等多种形式的内容。AI 智能体是利用此类模型自主执行任务的系统,通常通过串联工具和 API 实现。LangChain 或 Claude Code 等智能体框架提供了构建和运行这些智能体的基础设施。Qwen 是阿里巴巴的大语言和多模态模型系列,在基准测试中表现优异。

8月10日 04:04在 X 打开#multimodal #AI agents #Qwen #plugins #open source

078.0

Cloudflare 推出 Kitesurf:基于 Rust 的 AI 代理浏览器引擎,运行于 Workers

Cloudflare 推出了 Kitesurf,一个专为 AI 代理设计的全新浏览器引擎。它采用 Rust 编写,完全运行在 Cloudflare Workers 上,CPU 和内存消耗比 Chromium 低 3 到 7 倍。Kitesurf 遵循 Chrome DevTools 协议,任何能操控 Chrome 的工具都可以无缝操作它。 这大大降低了 AI 代理执行网页自动化任务时运行无头浏览器的成本和复杂性。通过用轻量级、可扩展的替代方案取代沉重的 Chromium 实例,开发者可以大规模部署基于代理的浏览、监控和测试,而无需配置昂贵的基础设施。这符合行业向专业化、代理优先云服务发展的趋势。 Kitesurf 是无状态的,按请求启动,因此具有高度可扩展性。目前处于免费测试阶段,可通过 kitesurf.cloudflare.app 访问。该引擎专注于对代理重要的方面——令牌数量和上下文窗口——而非完整的浏览器功能。它通过 CDP 与 Playwright 和 Claude Code 等现有自动化工具兼容。

@Pluvio9yte引用推文1 个视频赛博菩萨 Cloudflare 刚推出了 Kitesurf,给 Agent 专门做的浏览器引擎,跑在 Workers 上 Kitesurf 遵循 Chrome DevTools 协议,因此,任何能够操作 Chrome 的代理程序,都可以用来操作 Kitesurf。 如果你有下列的应用场景 • 需要Agent浏览网页星界 • 用 Claude Code / 自己脚本做 Playwright 自动化 • 批量监控、抓公开页、截图验收 那 Kitesurf 的用处是:把Agent 的眼睛从昂贵 Chrome 换成更便宜、更好扩的一层基建。 现在beta还是免费的,地址 http://kitesurf.cloudflare.app原推文媒体预览展开原推文收起原推文

@Pluvio9yte

赛博菩萨 Cloudflare 刚推出了 Kitesurf,给 Agent 专门做的浏览器引擎,跑在 Workers 上 Kitesurf 遵循 Chrome DevTools 协议,因此,任何能够操作 Chrome 的代理程序,都可以用来操作 Kitesurf。 如果你有下列的应用场景 • 需要Agent浏览网页星界 • 用 Claude Code / 自己脚本做 Playwright 自动化 • 批量监控、抓公开页、截图验收 那 Kitesurf 的用处是:把Agent 的眼睛从昂贵 Chrome 换成更便宜、更好扩的一层基建。 现在beta还是免费的,地址 http://kitesurf.cloudflare.app

@CloudflareDev

Introducing Kitesurf: a browser built for agents, running entirely on Cloudflare Workers. Chromium is too heavy to hand every agent one. Kitesurf is written in Rust, uses 3-7x less CPU and memory, and spins up per request. Free in beta: https://blog.cloudflare.com/kitesurf/

背景
无头浏览器用于在没有图形界面的情况下自动化网页交互,常用于测试、抓取和监控。Chromium 是最流行的引擎,但资源消耗大。Cloudflare Workers 是一个无服务器平台,可在靠近用户的边缘运行代码。Chrome DevTools 协议(CDP)是控制浏览器的标准接口,Puppeteer 和 Playwright 等工具都支持它。Kitesurf 利用这些技术提供了一个更精简、为代理优化的浏览解决方案。

8月10日 09:50在 X 打开#Cloudflare #AI agents #browser automation #Web Workers #Rust

088.0

微软开源 Skill Recorder:将屏幕录制转化为 AI 代理技能

微软开源了 Skill Recorder,这是一款桌面应用,可录制用户在屏幕上的操作,并利用 AI 自动将其还原为意图和有序步骤。该工具随后将这些步骤转化为可复用的技能,供 Microsoft Scout、Copilot Cowork 或 Copilot Studio 等 AI 代理使用。用户还可以在最终确定技能前对生成的步骤进行编辑。 为 AI 代理创建技能通常需要手动编写详细的分步指令,既耗时又容易出错。Skill Recorder 通过让用户仅需演示一次任务,大幅减少了这一工作量,使重复性工作流的自动化变得更加容易。这降低了非开发人员利用 AI 代理的门槛,并加速了企业环境中的采用。 Skill Recorder 可捕获屏幕操作和可选的麦克风音频,然后使用 GitHub Copilot CLI 分析录制内容并生成结构化流程。生成的技能使用代理自带的工具执行,从单次演示中归纳出通用流程。该工具已在 GitHub 上发布,并针对与微软代理生态系统的集成,包括 Copilot Studio。

@GitHub_Daily原推文2 张图片让 Agent 做重复性任务,目前比较好的方式通过 Skill,但比较费劲要一步步写操作流程。 最近微软开源了 Skill Recorder,通过把操作录一遍,AI 自动还原成意图和步骤。 我们还可以进行编辑修改,没问题后,再转成 Agent 能复用的 Skill。 在录屏时,还能开麦克风一边录屏一边口头描述,录完就让 AI 分析整段操作。 GitHub:http://github.com/microsoft/skill-recorder 生成的 Skill 会用 Agent 自带的工具来执行,从一次操作示范里归纳出通用流程。 经常要给 AI 写 Skill 操作指令的朋友可以试试,录一次比写半天文档快多了。原推文媒体预览+1展开原推文收起原推文

@GitHub_Daily

让 Agent 做重复性任务,目前比较好的方式通过 Skill,但比较费劲要一步步写操作流程。 最近微软开源了 Skill Recorder,通过把操作录一遍,AI 自动还原成意图和步骤。 我们还可以进行编辑修改,没问题后,再转成 Agent 能复用的 Skill。 在录屏时,还能开麦克风一边录屏一边口头描述,录完就让 AI 分析整段操作。 GitHub:http://github.com/microsoft/skill-recorder 生成的 Skill 会用 Agent 自带的工具来执行,从一次操作示范里归纳出通用流程。 经常要给 AI 写 Skill 操作指令的朋友可以试试,录一次比写半天文档快多了。

背景
AI 代理是能够自主执行任务的软件实体,通常由“技能”(包含指令和元数据的模块化包)引导。传统上,创建这些技能需要手动编写每个步骤,这需要技术专业知识。微软的 Skill Recorder 利用多模态 AI 观察人类演示并推断底层意图,类似于机器人流程自动化,但具有 AI 驱动的泛化能力。这种方法符合“可教导”代理的趋势,即通过示例学习而非显式编程。

8月11日 00:00在 X 打开#AI agents #Microsoft #open source #automation #skill recorder

098.0

Meta 开源 Muse Glimmer 30B 模型并预告 Muse Spark 1.2

Meta 发布了 Muse Glimmer 的权重,这是一个 300 亿参数的密集模型,针对消费级硬件本地运行进行了优化。该公司还宣布即将发布其最新前沿基础模型 Muse Spark 1.2 的权重。这些举措强化了 Meta 对开源 AI 发展的承诺。 开源像 Muse Glimmer 这样的强大模型使先进 AI 的获取民主化,让研究人员和开发者能够在本地运行智能体任务,而无需依赖云 API。即将发布的 Muse Spark 1.2 作为前沿模型,可能改变竞争格局,尤其是企业寻求闭源基础模型替代方案之际。这符合更广泛的行业向开放权重模型发展的趋势,挑战了专有 AI 系统的主导地位。 Muse Glimmer 是一个 300 亿参数的因果语言模型,配备专用感知编码器,从 Muse Spark 蒸馏而来,专为自主智能体任务设计。在 Q4_K_M 量化下,它需要约 20.4 GB 显存,使其能在 24 GB 显存的消费级 GPU 上运行。Muse Spark 1.2 为 Meta 的新 Muse Code 编码智能体提供动力,专为复杂、长时间的软件工程任务构建,能够协调多个子智能体。这两个模型均以开放权重许可证发布,但公告中未详细说明具体条款。

@realmadhuguru引用推文if you love intelligence, you set it free展开原推文收起原推文

@realmadhuguru

if you love intelligence, you set it free

@finkd

Today we're also opening the weights for Muse Glimmer, a great 30B parameter dense model that can run locally. Soon we'll also release the weights for Muse Spark 1.2, our latest foundation model. Meta is a strong supporter of open source and I'm proud of these releases. Congrats to @alexandr_wang and the MSL team for all your great work on these models.

背景
开放权重模型允许用户访问和修改模型参数,促进透明度和定制化,而闭源模型仅提供 API 访问。Meta 一直是开源 AI 的著名倡导者,此前发布了 LLaMA 和 Llama 2 等模型。“智能体任务”一词指能够自主执行多步骤操作的 AI 系统,例如浏览网页或控制软件。蒸馏是一种技术,通过训练较小的“学生”模型来模仿较大的“教师”模型,在保持大部分能力的同时提高效率。消费级硬件通常包括 NVIDIA RTX 3090 或 4090 等 GPU,它们拥有 24 GB 显存,适合运行大型模型的量化版本。

8月10日 14:47在 X 打开#Meta #open-source #AI #Muse #model release

107.0

Anthropic Labs 团队通过内部狗粮测试驱动产品成功

Anthropic 的产品开发流程依赖一个专门的 Labs 团队,该团队同时运行数百个内部原型。只有那些通过严格的狗粮测试,在周活和留存上表现优异的产品才会对外发布。Claude Tag 就是一个典型例子,它在内部打磨了数月后于今年六月正式推出。 这种方法确保只有经过验证、高影响力的产品才能触达用户,降低了市场失败的风险。它凸显了 AI 开发从纯研究转向产品-市场匹配的趋势,强调以用户为中心的迭代。其他 AI 公司可能会采用类似方法,在加速创新的同时保持质量。 Labs 团队充当内部加速器,快速原型化那些对核心产品流程来说尚不成熟的 AI 能力。原型在真实工作环境中测试,许多因需求不足或模型能力不成熟而被放弃。只有一小部分能在反复的狗粮测试中存活下来,成为公开产品。

@lifesinger@dotey 转推1 张图片Anthropic 的产品,为什么这么厉害。 刚看了公众号《海外独角兽》的最新文章。非常不错,强烈推荐。 Anthropic 公司里有个 Labs 团队。 Labs 团队会围绕不同的技术判断播下大量种子,再把它们放进 Anthropic 内部的真实工作环境里生长。有些很快因为需求不足而枯萎,有些因模型能力的季节还没到,暂时进入休眠。只有极少数能在反复的 Dogfooding 中逐渐扎根。   最终,一个产品只有在内部目标用户中跑出足够好的周活和留存,才有机会对外发布。Anthropic 现在同时运行着几百个原型,其中绝大多数永远都不会面世。 Claude Tag 最早也是这样一个内部实验。它经历了几个月的真实使用和反复打磨,先改变了 Anthropic 自己的工作方式,直到今年 6 月才正式对外发布。原推文媒体预览展开原推文收起原推文

@dotey 转推了

@lifesinger

Anthropic 的产品,为什么这么厉害。 刚看了公众号《海外独角兽》的最新文章。非常不错,强烈推荐。 Anthropic 公司里有个 Labs 团队。 Labs 团队会围绕不同的技术判断播下大量种子,再把它们放进 Anthropic 内部的真实工作环境里生长。有些很快因为需求不足而枯萎,有些因模型能力的季节还没到,暂时进入休眠。只有极少数能在反复的 Dogfooding 中逐渐扎根。   最终,一个产品只有在内部目标用户中跑出足够好的周活和留存,才有机会对外发布。Anthropic 现在同时运行着几百个原型,其中绝大多数永远都不会面世。 Claude Tag 最早也是这样一个内部实验。它经历了几个月的真实使用和反复打磨,先改变了 Anthropic 自己的工作方式,直到今年 6 月才正式对外发布。

背景
狗粮测试(Dogfooding)是指公司使用自家产品以验证质量和用户体验的做法。Anthropic 是一家以 Claude 系列大语言模型闻名的 AI 安全公司。Labs 团队的成立是为了弥合研究突破与市场就绪产品之间的鸿沟,确保新功能在公开发布前经过内部实战检验。

8月10日 16:02在 X 打开#Anthropic #product development #AI #dogfooding #Claude Tag

117.0

LangChain 教程:用 Stagehand v4 和 Managed Deep Agents 构建网页浏览智能体

LangChain 发布了一个教程,展示如何使用 Stagehand v4(Browserbase 提供的开源浏览器自动化 SDK)和 Managed Deep Agents(在 LangSmith 上部署代码优先智能体的托管运行时)构建一个生产就绪的网页浏览智能体。该教程发布在 YouTube 上,向开发者演示如何结合这些工具创建能够自主浏览和交互网页的智能体。 该教程降低了开发者构建可靠网页浏览智能体的门槛,这类智能体对于自动化需要互联网访问的知识工作至关重要。通过将 Stagehand 的自然语言浏览器控制与 LangChain 的托管基础设施相结合,它实现了可扩展的生产级智能体部署,有望加速 AI 智能体在企业工作流中的采用。 Stagehand v4 是一个开源 SDK,允许智能体使用自然语言和代码控制网页浏览器,基于 Playwright 构建。Managed Deep Agents 允许开发者将智能体定义为代码文件夹,并使用 CLI 将其部署到 LangSmith 的托管运行时上。该教程是一个视频演示,这种组合旨在实现生产就绪,但公告中未披露具体的基准测试或定价细节。

@hwchase17@LangChain 转推1 张图片💻How to build a web browsing agent Stagehand v4 is an SDK to let agents browse the web from @browserbase We created a tutorial to show how you could use Stagehand with Managed Deep Agents to create a production ready web browsing agent https://youtu.be/O0hkpChFBkM原推文媒体预览展开原推文收起原推文

@LangChain 转推了

@hwchase17

💻How to build a web browsing agent Stagehand v4 is an SDK to let agents browse the web from @browserbase We created a tutorial to show how you could use Stagehand with Managed Deep Agents to create a production ready web browsing agent https://youtu.be/O0hkpChFBkM

背景
Stagehand 是一个浏览器自动化框架,简化了 AI 智能体控制网页浏览器的过程,提供了比原始 Playwright 更高级的抽象。LangChain 是一个流行的用于构建大语言模型应用的框架,LangSmith 是其用于测试、调试和部署 LLM 应用的平台。Managed Deep Agents 是一项处理智能体运行基础设施的服务,使开发者可以专注于智能体逻辑。网页浏览智能体是能够像人类用户一样导航网站、提取信息并执行操作的 AI 系统。

8月10日 18:38在 X 打开#AI agents #web browsing #SDK #tutorial #LangChain

127.0

AI 可观测性与追踪在 RAG 系统中的重要性解析

Aurimas_Gr 发布的技术推文(由 bibryam 转推)在简单 RAG 系统的背景下解释了 AI 可观测性与追踪。它定义了编排器、追踪和跨度等关键概念,并说明了追踪如何在每一步捕获元数据,如令牌计数和检索相关性。该推文强调追踪对于调试、成本估算和评估非确定性生成式 AI 系统至关重要。 随着 AI 系统变得日益复杂和非确定性,传统监控已不足够;具备追踪能力的 AI 可观测性使工程师能够精确定位故障、优化成本并保持质量。这对于生产环境中的 RAG 应用至关重要,因为从嵌入到 LLM 调用的任何步骤都可能出错,且成本随令牌使用量变化。这一实践正成为 AI 工程师工具箱中的标准组成部分,与更广泛的 MLOps 趋势保持一致。 一个追踪代表从查询到答案的端到端流程,由跨度组成,这些跨度捕获嵌入、ANN 查找、提示构建和 LLM 调用等原子操作。每个跨度记录开始/结束时间、输入/输出以及特定于 GenAI 的元数据,如令牌计数和检索上下文相关性。追踪实现了步骤级评估,这对于随时间退化且需要逐组件调优的 GenAI 系统是必要的。该推文以简单 RAG 系统为例,但这些概念适用于更复杂的基于代理的架构。

@Aurimas_Gr@bibryam 转推1 张图片𝗔𝗜 𝗢𝗯𝘀𝗲𝗿𝘃𝗮𝗯𝗶𝗹𝗶𝘁𝘆 is a must have in your tool belt as an AI Engineer. 𝗧𝗿𝗮𝗰𝗶𝗻𝗴 sits at the core of it, why is it important? Tracing and instrumentation of software have been around for decades now. With AI systems resembling regular software even more, we are now moving the practice here as well (with a few key differences). Let’s look into the process of tracing from a perspective of a naive RAG system. 𝘍𝘦𝘸 𝘥𝘦𝘧𝘪𝘯𝘪𝘵𝘪𝘰𝘯𝘴: 𝘼) An Orchestrator in the GenAI system application is the central piece of software that orchestrates the end-to-end process. Think of apps using LangChain, LlamaIndex or Haystack. 𝘽) Trace is the end-to-end application flow from the entry point till the answer is produced, it is composed of smaller pieces called spans. 𝘾) Span is a smaller piece of the application flow that represents an atomic action like a function call or a database query. They can be sequential, or run in parallel. ℹ️ As part of span we capture general metadata like start and end time, inputs and outputs of the span. On top of this metadata we track information specific to the GenAI system elements. What might a trace look like for a naive RAG system? 𝟭. A query that has been submitted to the chat application. 𝟮. The query is embedded into a vector. ✅ Additional metadata like input token count is persisted with the span so that we can estimate the cost of the procedure. 𝟯. ANN lookup performed against the Vector DB to retrieve the most relevant context. ✅ Additional metadata about the query is persisted as part of the span together with the retrieved pieces of context and their relevance. 𝟰. A prompt is constructed from the system prompt and retrieved context. 𝟱. The prompt is passed to the LLM to construct the answer. ✅ Additional metadata about input and output token count is captured together with the span so that we can estimate the cost of the procedure. 𝘞𝘩𝘺 𝘪𝘴 𝘵𝘳𝘢𝘤𝘪𝘯𝘨 𝘰𝘧 𝘎𝘦𝘯𝘈𝘐 𝘴𝘺𝘴𝘵𝘦𝘮𝘴 𝘪𝘮𝘱𝘰𝘳𝘵𝘢𝘯𝘵? - These applications are usually complex chains, errors can happen in different steps of your application. E.g. Embedding of query is taking longer than expected or you have reached API limits of LLM provider. - Cost for calling LLM APIs will be variable depending on the length of inputs and produced outputs. You would usually trace this information and analyze it to help forecast expenses. - GenAI systems are non-deterministic and will deteriorate over time. They need to be evaluated on span level rather than input/output of the entire system so that you can tune each piece separately. - … Are you tracing your Agents? Let me know in the comments 👇原推文媒体预览展开原推文收起原推文

@bibryam 转推了

@Aurimas_Gr

𝗔𝗜 𝗢𝗯𝘀𝗲𝗿𝘃𝗮𝗯𝗶𝗹𝗶𝘁𝘆 is a must have in your tool belt as an AI Engineer. 𝗧𝗿𝗮𝗰𝗶𝗻𝗴 sits at the core of it, why is it important? Tracing and instrumentation of software have been around for decades now. With AI systems resembling regular software even more, we are now moving the practice here as well (with a few key differences). Let’s look into the process of tracing from a perspective of a naive RAG system. 𝘍𝘦𝘸 𝘥𝘦𝘧𝘪𝘯𝘪𝘵𝘪𝘰𝘯𝘴: 𝘼) An Orchestrator in the GenAI system application is the central piece of software that orchestrates the end-to-end process. Think of apps using LangChain, LlamaIndex or Haystack. 𝘽) Trace is the end-to-end application flow from the entry point till the answer is produced, it is composed of smaller pieces called spans. 𝘾) Span is a smaller piece of the application flow that represents an atomic action like a function call or a database query. They can be sequential, or run in parallel. ℹ️ As part of span we capture general metadata like start and end time, inputs and outputs of the span. On top of this metadata we track information specific to the GenAI system elements. What might a trace look like for a naive RAG system? 𝟭. A query that has been submitted to the chat application. 𝟮. The query is embedded into a vector. ✅ Additional metadata like input token count is persisted with the span so that we can estimate the cost of the procedure. 𝟯. ANN lookup performed against the Vector DB to retrieve the most relevant context. ✅ Additional metadata about the query is persisted as part of the span together with the retrieved pieces of context and their relevance. 𝟰. A prompt is constructed from the system prompt and retrieved context. 𝟱. The prompt is passed to the LLM to construct the answer. ✅ Additional metadata about input and output token count is captured together with the span so that we can estimate the cost of the procedure. 𝘞𝘩𝘺 𝘪𝘴 𝘵𝘳𝘢𝘤𝘪𝘯𝘨 𝘰𝘧 𝘎𝘦𝘯𝘈𝘐 𝘴𝘺𝘴𝘵𝘦𝘮𝘴 𝘪𝘮𝘱𝘰𝘳𝘵𝘢𝘯𝘵? - These applications are usually complex chains, errors can happen in different steps of your application. E.g. Embedding of query is taking longer than expected or you have reached API limits of LLM provider. - Cost for calling LLM APIs will be variable depending on the length of inputs and produced outputs. You would usually trace this information and analyze it to help forecast expenses. - GenAI systems are non-deterministic and will deteriorate over time. They need to be evaluated on span level rather than input/output of the entire system so that you can tune each piece separately. - … Are you tracing your Agents? Let me know in the comments 👇

背景
AI 可观测性将传统软件可观测性扩展到 AI 系统,重点关注响应质量、令牌使用和模型漂移等信号。RAG(检索增强生成)是一种常见模式,语言模型在生成答案前从向量数据库中检索相关上下文。追踪作为核心可观测性技术,记录请求跨服务的执行路径;在 AI 系统中,它捕获模型调用和数据转换的序列。像 LangChain 或 LlamaIndex 这样的编排器管理这些多步骤工作流。理解跨度和追踪对于调试和优化生产环境中的 AI 应用至关重要。

8月10日 20:55在 X 打开#AI Observability #Tracing #RAG #AI Engineering #LLM