- Claude AI 将黎曼猜想临界线零点比例下界提升至 67.2%10.0
- OpenAI 推出用于漏洞研究的 GPT-5.6-Cyber 模型9.0
- Kimi K2.5 参与者:AI 智能提升,harness 复杂度随之增长8.0
- Cursor人才主管揭秘打造顶尖技术团队的招聘策略8.0
- Anthropic 为 Claude 输出添加隐形水印和 C2PA 元数据8.0
- Qwen-MM-Plugins 将多模态模型转化为多模态智能体8.0
- Cloudflare 推出 Kitesurf:基于 Rust 的 AI 代理浏览器引擎,运行于 Workers8.0
- 微软开源 Skill Recorder:将屏幕录制转化为 AI 代理技能8.0
- Meta 开源 Muse Glimmer 30B 模型并预告 Muse Spark 1.28.0
- Anthropic Labs 团队通过内部狗粮测试驱动产品成功7.0
- LangChain 教程:用 Stagehand v4 和 Managed Deep Agents 构建网页浏览智能体7.0
- AI 可观测性与追踪在 RAG 系统中的重要性解析7.0
0110.0
Claude AI 将黎曼猜想临界线零点比例下界提升至 67.2%
Anthropic 披露,一个未公开的研究版 Claude 在与黎曼猜想相关的问题上取得了重大突破。它将黎曼 ζ 函数非平凡零点落在临界线上的已知比例下界从 41.6% 提升至 67.2%,实现了超过 25 个百分点的历史性单步跃升。该证明已由数学家验证,并在 Lean 证明助手中形式化。 这一结果表明,AI 能够在前沿数学研究中做出原创性、高影响力的贡献,而不仅仅是解决已有问题。67.2% 的界限是这一研究方向 80 年历史上最大的单次提升,超越了人类数十年的渐进式进展。这预示着数学研究方式可能发生转变,AI 将作为创造性合作者参与其中。 Claude 结合了 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 近年来的工作以及 Bombieri 在 2000 年的一篇论文。整个过程在 1.5 天内动用了 60 个子智能体、2400 条命令和数百个 Python 脚本。证明由数学家 Levent Alpöge、Ralph Furman、Brian Conrey 和 Dan Goldston 审阅,并用 Lean 编写了机器可验证的版本。Anthropic 指出,这种方法不太可能直接证明完整的黎曼猜想。
背景
黎曼猜想于 1859 年提出,声称黎曼 ζ 函数的所有非平凡零点都位于临界线 Re(s)=1/2 上。它是七大千禧年难题之一。由于完整证明难以实现,数学家们转而寻求临界线上零点比例的下界。关键里程碑包括 Selberg(1942 年,正比例)、Levinson(1974 年,>1/3)、Conrey(1989 年,>2/5)和 Pratt 等人(2020 年,41.7%)。Lean 是一种允许对数学证明进行形式化验证的证明助手。
8月10日 19:48在 X 打开#AI #mathematics #Riemann hypothesis #Claude #breakthrough
029.0
OpenAI 推出用于漏洞研究的 GPT-5.6-Cyber 模型
OpenAI 发布了专为网络安全设计的 GPT-5.6-Cyber 模型,并扩展了 Daybreak 计划,新增 Blue 和 Red 两个访问层级。该模型已用于真实世界的漏洞研究,发现了 Chrome V8 引擎等开源软件中此前未知的漏洞。访问权限仅限于经过批准的防御者,并对高风险工作施加额外控制。 此举在攻击者将类似技术武器化之前,将先进 AI 能力交到防御者手中,可能缩小网络防御的窗口期。它标志着向主动式 AI 辅助安全的转变,影响漏洞研究人员、安全团队和更广泛的软件供应链。受限访问模式也为在敏感领域负责任地部署强大 AI 树立了先例。 GPT-5.6-Cyber 通过 Daybreak Red 层级提供,定价为每百万输出 token 12.50 美元。Daybreak Blue 提供 GPT-5.6-Sol 等通用模型并配有定制化防护措施,而 Red 则提供专门的网络安全模型。测试中,GPT-5.6-Sol 仅响应了 1.5% 的恶意请求,Blue 版本仅响应 2%,显示出强大的安全措施。
背景
OpenAI 的 Daybreak 计划旨在通过向可信合作伙伴提供 AI 工具来加速网络防御。Chrome 的 V8 是 Google Chrome 和 Node.js 中使用的 JavaScript 引擎,是 Web 安全的关键组件。漏洞研究涉及在软件缺陷被利用之前发现并报告它们。“网络防御窗口”指防御者在攻击者利用漏洞之前进行修补的时间。
8月10日 17:16在 X 打开#AI #Cybersecurity #OpenAI #GPT-5.6-Cyber #Vulnerability Research
038.0
Kimi K2.5 参与者:AI 智能提升,harness 复杂度随之增长
一位参与 Kimi K2.5 训练的从业者指出,随着 AI 模型智能的提升,harness(模型外围的脚手架代码)并非变得更简单,而是愈发复杂。他们提到,并行工具调用、子代理、代理集群等功能的加入是为了解锁新能力,这种复杂化是 AI 系统演进的必经阶段。 这一观点挑战了“更聪明的模型会消除复杂脚手架”的普遍假设。它表明模型智能与 harness 复杂度之间存在动态的协同演化关系,这对智能体 AI 系统的设计具有深远影响。类比人类进化,意味着随着 AI 进步,其与世界的交互将更加丰富和复杂,可能重塑软件乃至社会。 作者曾参与 Kimi K2.5 和 Kimi CLI 的开发,观察到随着模型进步,他们原本计划移除子代理和并行工具调用等功能,但随后又出现了主动上下文回退等新能力。他们引用“阴阳”比喻,并预测 harness 最终将与人类的社会基础设施融合,导致所有软件被重新构想。
背景
在 AI 智能体中,“harness”(或脚手架)是包裹模型的代码,负责工具执行、记忆、上下文管理和验证,让模型专注于推理。随着模型能力增强,有人认为 harness 可以简化,但这条推文认为,更高的智能会催生更复杂的交互,从而需要更复杂的 harness。Kimi K2.5 是月之暗面推出的视觉智能体模型,基于 15 万亿 token 训练。
社区讨论
该推文是一个关于 harness 本质的讨论串的一部分,另一位用户将 harness 描述为与模型互补的“不变结构机制”。作者基于实践经验的细致观点引发了关于智能体脚手架演变角色的思考和互动。
8月10日 07:12在 X 打开#AI agents #harness #Kimi K2.5 #agent scaffolding #model intelligence
048.0
Cursor人才主管揭秘打造顶尖技术团队的招聘策略
Cursor人才主管Adam Ward分享了关于前线部署工程师(FDE)需求激增的见解,这类人才兼具深厚技术功底与面向客户的能力。他批评传统招聘漏斗是导致团队平庸的“死亡漏斗”,并主张将每次招聘都视为高管猎聘。Ward还强调了接受offer后的跟进、实战考察以及精心绘制候选人图谱的重要性。 这些见解反映了科技行业招聘向更具战略性、高接触流程的转变,以在激烈竞争中争夺顶尖人才。对FDE的重视表明,市场越来越需要能够连接产品与销售、直接影响业务成果的工程师。采用这些实践有助于初创公司和科技企业打造高密度人才团队,避免传统招聘的陷阱。 Ward将FDE热潮比作当年的移动端工程师招聘潮,但指出现在变化发生在几天或几周内。他建议用具体的问题取代泛泛的推荐询问,以获得精准推荐。Cursor为每位核心候选人设立专属Slack频道并召开每日站会,并将接受offer后的时期视为一场战役,包括入职前聚餐和寄送笔记本电脑。实战考察被认为是预测成功的最佳指标,Cursor曾在取消后因团队信心下降而重新启用。
背景
前线部署工程师直接与客户合作,实施和优化复杂技术系统,融合了软件开发与客户成功。高管猎聘是一种通常用于高级职位的定向招聘方法,包括严谨的岗位界定、候选人图谱绘制和持续跟进。传统招聘漏斗依赖主动申请者和逐轮筛选,可能过滤掉顶尖的被动候选人。Cursor是一家以AI驱动代码编辑器闻名的公司,以团队高度精英化著称,近期被Elon Musk以600亿美元收购。
8月10日 22:04在 X 打开#hiring #tech talent #forward deployed engineers #startups #talent acquisition
058.0
Anthropic 为 Claude 输出添加隐形水印和 C2PA 元数据
Anthropic 已开始在所有新 Claude 模型的输出中嵌入隐形文本水印和符合 C2PA 标准的数字签名元数据,自 2026 年 8 月 2 日起生效。水印在文本被复制粘贴后依然存在,元数据则附加到生成的 SVG、PNG 和 JPG 等文件中。此次部署覆盖全球所有 Claude 产品,包括 API、网页版和云平台。 这使得 Anthropic 成为首家大规模部署文本水印的主流 AI 实验室,此举是为了遵守欧盟 AI 法案第 50 条的透明度要求。它为 AI 生成文本的内容溯源设立了先例,可能影响行业标准,并帮助用户识别 AI 生成的内容。此举也可能促使其他 AI 提供商采取类似措施。 文本水印直接嵌入文本中,而非作为元数据,可经受一定程度的编辑,但大量改写或文本过短时可能丢失。检测仅表明内容可能经过 Claude 处理,不确认作者身份。文件元数据遵循 C2PA 开放标准,OpenAI 和 Google 已在图像生成中使用。对于 8 月 2 日前发布的 Claude 模型,Anthropic 仍在补充标记功能,尚未公布时间表。
背景
欧盟 AI 法案第 50 条要求某些 AI 系统的提供商在用户与 AI 交互或内容为 AI 生成时告知用户。C2PA 标准由 Adobe、微软、Google 等共同开发,提供了一种为数字内容附加溯源元数据的方法。文本水印将隐藏模式嵌入 AI 生成的文本中以便检测,但其鲁棒性和可靠性存在局限。
社区讨论
有评论者幽默地指出,使用 AI 生成文本时用户自己就成了水印,凸显了标记常被整合进人类工作内容的讽刺意味。另一人强调水印作为文本一部分而非仅元数据的重要性,因为它会随复制内容一起传播。
8月10日 21:33在 X 打开#AI #Anthropic #watermarking #content provenance #EU AI Act
068.0
Qwen-MM-Plugins 将多模态模型转化为多模态智能体
阿里巴巴通义千问团队发布了 Qwen-MM-Plugins,一个开源代码库,将多模态能力打包为可安装的技能,供现有智能体框架使用。它使智能体能够原生处理图像、视频、文档和 3D/CAD 数据。该系统与六种主流智能体框架集成,无需重新开发底层工具。 这弥合了强大的多模态模型与实际智能体应用之间的鸿沟,使开发者能够轻松为其 AI 智能体添加视觉、视频编辑和 3D 理解能力。它加速了多模态智能体在设计、媒体和工程等行业的应用。通过支持多种智能体框架,它促进了开放生态并减少了供应商锁定。 Qwen-MM-Plugins 使用各框架的原生安装方式,并写入一个共享配置文件(~/.qwen-mm-plugins/config)。它提供模块化的多模态技能和 MCP 服务器,支持 Open WebUI、Claude Code 和 Cline 等客户端的安装。该代码库已在 GitHub 上开源,但尚未披露具体的性能基准或定价。
背景
多模态 AI 模型能够理解并生成文本、图像、音频和视频等多种形式的内容。AI 智能体是利用此类模型自主执行任务的系统,通常通过串联工具和 API 实现。LangChain 或 Claude Code 等智能体框架提供了构建和运行这些智能体的基础设施。Qwen 是阿里巴巴的大语言和多模态模型系列,在基准测试中表现优异。
8月10日 04:04在 X 打开#multimodal #AI agents #Qwen #plugins #open source
078.0
Cloudflare 推出 Kitesurf:基于 Rust 的 AI 代理浏览器引擎,运行于 Workers
Cloudflare 推出了 Kitesurf,一个专为 AI 代理设计的全新浏览器引擎。它采用 Rust 编写,完全运行在 Cloudflare Workers 上,CPU 和内存消耗比 Chromium 低 3 到 7 倍。Kitesurf 遵循 Chrome DevTools 协议,任何能操控 Chrome 的工具都可以无缝操作它。 这大大降低了 AI 代理执行网页自动化任务时运行无头浏览器的成本和复杂性。通过用轻量级、可扩展的替代方案取代沉重的 Chromium 实例,开发者可以大规模部署基于代理的浏览、监控和测试,而无需配置昂贵的基础设施。这符合行业向专业化、代理优先云服务发展的趋势。 Kitesurf 是无状态的,按请求启动,因此具有高度可扩展性。目前处于免费测试阶段,可通过 kitesurf.cloudflare.app 访问。该引擎专注于对代理重要的方面——令牌数量和上下文窗口——而非完整的浏览器功能。它通过 CDP 与 Playwright 和 Claude Code 等现有自动化工具兼容。
背景
无头浏览器用于在没有图形界面的情况下自动化网页交互,常用于测试、抓取和监控。Chromium 是最流行的引擎,但资源消耗大。Cloudflare Workers 是一个无服务器平台,可在靠近用户的边缘运行代码。Chrome DevTools 协议(CDP)是控制浏览器的标准接口,Puppeteer 和 Playwright 等工具都支持它。Kitesurf 利用这些技术提供了一个更精简、为代理优化的浏览解决方案。
8月10日 09:50在 X 打开#Cloudflare #AI agents #browser automation #Web Workers #Rust
088.0
微软开源 Skill Recorder:将屏幕录制转化为 AI 代理技能
微软开源了 Skill Recorder,这是一款桌面应用,可录制用户在屏幕上的操作,并利用 AI 自动将其还原为意图和有序步骤。该工具随后将这些步骤转化为可复用的技能,供 Microsoft Scout、Copilot Cowork 或 Copilot Studio 等 AI 代理使用。用户还可以在最终确定技能前对生成的步骤进行编辑。 为 AI 代理创建技能通常需要手动编写详细的分步指令,既耗时又容易出错。Skill Recorder 通过让用户仅需演示一次任务,大幅减少了这一工作量,使重复性工作流的自动化变得更加容易。这降低了非开发人员利用 AI 代理的门槛,并加速了企业环境中的采用。 Skill Recorder 可捕获屏幕操作和可选的麦克风音频,然后使用 GitHub Copilot CLI 分析录制内容并生成结构化流程。生成的技能使用代理自带的工具执行,从单次演示中归纳出通用流程。该工具已在 GitHub 上发布,并针对与微软代理生态系统的集成,包括 Copilot Studio。
背景
AI 代理是能够自主执行任务的软件实体,通常由“技能”(包含指令和元数据的模块化包)引导。传统上,创建这些技能需要手动编写每个步骤,这需要技术专业知识。微软的 Skill Recorder 利用多模态 AI 观察人类演示并推断底层意图,类似于机器人流程自动化,但具有 AI 驱动的泛化能力。这种方法符合“可教导”代理的趋势,即通过示例学习而非显式编程。
8月11日 00:00在 X 打开#AI agents #Microsoft #open source #automation #skill recorder
098.0
Meta 开源 Muse Glimmer 30B 模型并预告 Muse Spark 1.2
Meta 发布了 Muse Glimmer 的权重,这是一个 300 亿参数的密集模型,针对消费级硬件本地运行进行了优化。该公司还宣布即将发布其最新前沿基础模型 Muse Spark 1.2 的权重。这些举措强化了 Meta 对开源 AI 发展的承诺。 开源像 Muse Glimmer 这样的强大模型使先进 AI 的获取民主化,让研究人员和开发者能够在本地运行智能体任务,而无需依赖云 API。即将发布的 Muse Spark 1.2 作为前沿模型,可能改变竞争格局,尤其是企业寻求闭源基础模型替代方案之际。这符合更广泛的行业向开放权重模型发展的趋势,挑战了专有 AI 系统的主导地位。 Muse Glimmer 是一个 300 亿参数的因果语言模型,配备专用感知编码器,从 Muse Spark 蒸馏而来,专为自主智能体任务设计。在 Q4_K_M 量化下,它需要约 20.4 GB 显存,使其能在 24 GB 显存的消费级 GPU 上运行。Muse Spark 1.2 为 Meta 的新 Muse Code 编码智能体提供动力,专为复杂、长时间的软件工程任务构建,能够协调多个子智能体。这两个模型均以开放权重许可证发布,但公告中未详细说明具体条款。
背景
开放权重模型允许用户访问和修改模型参数,促进透明度和定制化,而闭源模型仅提供 API 访问。Meta 一直是开源 AI 的著名倡导者,此前发布了 LLaMA 和 Llama 2 等模型。“智能体任务”一词指能够自主执行多步骤操作的 AI 系统,例如浏览网页或控制软件。蒸馏是一种技术,通过训练较小的“学生”模型来模仿较大的“教师”模型,在保持大部分能力的同时提高效率。消费级硬件通常包括 NVIDIA RTX 3090 或 4090 等 GPU,它们拥有 24 GB 显存,适合运行大型模型的量化版本。
8月10日 14:47在 X 打开#Meta #open-source #AI #Muse #model release
107.0
Anthropic Labs 团队通过内部狗粮测试驱动产品成功
Anthropic 的产品开发流程依赖一个专门的 Labs 团队,该团队同时运行数百个内部原型。只有那些通过严格的狗粮测试,在周活和留存上表现优异的产品才会对外发布。Claude Tag 就是一个典型例子,它在内部打磨了数月后于今年六月正式推出。 这种方法确保只有经过验证、高影响力的产品才能触达用户,降低了市场失败的风险。它凸显了 AI 开发从纯研究转向产品-市场匹配的趋势,强调以用户为中心的迭代。其他 AI 公司可能会采用类似方法,在加速创新的同时保持质量。 Labs 团队充当内部加速器,快速原型化那些对核心产品流程来说尚不成熟的 AI 能力。原型在真实工作环境中测试,许多因需求不足或模型能力不成熟而被放弃。只有一小部分能在反复的狗粮测试中存活下来,成为公开产品。
背景
狗粮测试(Dogfooding)是指公司使用自家产品以验证质量和用户体验的做法。Anthropic 是一家以 Claude 系列大语言模型闻名的 AI 安全公司。Labs 团队的成立是为了弥合研究突破与市场就绪产品之间的鸿沟,确保新功能在公开发布前经过内部实战检验。
8月10日 16:02在 X 打开#Anthropic #product development #AI #dogfooding #Claude Tag
117.0
LangChain 教程:用 Stagehand v4 和 Managed Deep Agents 构建网页浏览智能体
LangChain 发布了一个教程,展示如何使用 Stagehand v4(Browserbase 提供的开源浏览器自动化 SDK)和 Managed Deep Agents(在 LangSmith 上部署代码优先智能体的托管运行时)构建一个生产就绪的网页浏览智能体。该教程发布在 YouTube 上,向开发者演示如何结合这些工具创建能够自主浏览和交互网页的智能体。 该教程降低了开发者构建可靠网页浏览智能体的门槛,这类智能体对于自动化需要互联网访问的知识工作至关重要。通过将 Stagehand 的自然语言浏览器控制与 LangChain 的托管基础设施相结合,它实现了可扩展的生产级智能体部署,有望加速 AI 智能体在企业工作流中的采用。 Stagehand v4 是一个开源 SDK,允许智能体使用自然语言和代码控制网页浏览器,基于 Playwright 构建。Managed Deep Agents 允许开发者将智能体定义为代码文件夹,并使用 CLI 将其部署到 LangSmith 的托管运行时上。该教程是一个视频演示,这种组合旨在实现生产就绪,但公告中未披露具体的基准测试或定价细节。
背景
Stagehand 是一个浏览器自动化框架,简化了 AI 智能体控制网页浏览器的过程,提供了比原始 Playwright 更高级的抽象。LangChain 是一个流行的用于构建大语言模型应用的框架,LangSmith 是其用于测试、调试和部署 LLM 应用的平台。Managed Deep Agents 是一项处理智能体运行基础设施的服务,使开发者可以专注于智能体逻辑。网页浏览智能体是能够像人类用户一样导航网站、提取信息并执行操作的 AI 系统。
8月10日 18:38在 X 打开#AI agents #web browsing #SDK #tutorial #LangChain
127.0
AI 可观测性与追踪在 RAG 系统中的重要性解析
Aurimas_Gr 发布的技术推文(由 bibryam 转推)在简单 RAG 系统的背景下解释了 AI 可观测性与追踪。它定义了编排器、追踪和跨度等关键概念,并说明了追踪如何在每一步捕获元数据,如令牌计数和检索相关性。该推文强调追踪对于调试、成本估算和评估非确定性生成式 AI 系统至关重要。 随着 AI 系统变得日益复杂和非确定性,传统监控已不足够;具备追踪能力的 AI 可观测性使工程师能够精确定位故障、优化成本并保持质量。这对于生产环境中的 RAG 应用至关重要,因为从嵌入到 LLM 调用的任何步骤都可能出错,且成本随令牌使用量变化。这一实践正成为 AI 工程师工具箱中的标准组成部分,与更广泛的 MLOps 趋势保持一致。 一个追踪代表从查询到答案的端到端流程,由跨度组成,这些跨度捕获嵌入、ANN 查找、提示构建和 LLM 调用等原子操作。每个跨度记录开始/结束时间、输入/输出以及特定于 GenAI 的元数据,如令牌计数和检索上下文相关性。追踪实现了步骤级评估,这对于随时间退化且需要逐组件调优的 GenAI 系统是必要的。该推文以简单 RAG 系统为例,但这些概念适用于更复杂的基于代理的架构。
背景
AI 可观测性将传统软件可观测性扩展到 AI 系统,重点关注响应质量、令牌使用和模型漂移等信号。RAG(检索增强生成)是一种常见模式,语言模型在生成答案前从向量数据库中检索相关上下文。追踪作为核心可观测性技术,记录请求跨服务的执行路径;在 AI 系统中,它捕获模型调用和数据转换的序列。像 LangChain 或 LlamaIndex 这样的编排器管理这些多步骤工作流。理解跨度和追踪对于调试和优化生产环境中的 AI 应用至关重要。
8月10日 20:55在 X 打开#AI Observability #Tracing #RAG #AI Engineering #LLM