- Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,性能大幅提升并降价8.0
- OpenAI 的 Astra 模型在预备框架下达到关键网络安全阈值8.0
- 阿里巴巴通义千问发布面向真实商业运营的 CommerceAgentBench 基准7.0
- 从首帧准确提取视觉风格以复刻爆款AIGC视频7.0
- Mirobody:开源 AI 健康数据引擎统一碎片化健康数据7.0
- tokentab:本地追踪 Claude Code、Codex 和 Gemini CLI 的 token 用量7.0
- OpenKB:把文档文件夹变成自动维护的 AI 维基7.0
- Inkeep 开源 OpenKnowledge:类 Notion 体验的 AI 原生 Markdown 编辑器7.0
- Tailscale 发布 tailcat:点对点文件传输工具7.0
- 超越模型推理:用分布式系统模式降低AI应用延迟7.0
- 用AI智能体构建自改进产品的框架7.0
- Effect 成为 TypeScript 后端开发的必备库7.0
018.0
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,性能大幅提升并降价
Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1,两者是同一模型,但安全限制不同。Fable 5.1 在 Terminal-Bench-Science 基准测试中的得分翻倍(52.6% 对比 Fable 5 的 24.7%),并在 Terminal-Bench 4.0 编程任务上超过了 Opus 5。缓存读取价格下降 75% 至每百万 token 0.25 美元,同时 Anthropic 推出了企业前沿安全措施(EFS)以解决数据留存争议。 此次发布解决了企业最关心的三个问题:性能、成本和数据隐私。缓存读取价格下降 75% 可使智能体工作负载的总成本降低 25-45%,让 Fable 系列对成本敏感的企业更具吸引力。EFS 方案直接回应了 OpenAI 最近的 Private Safety Processing 产品,消除了金融、医疗等受监管行业采购的主要障碍。 Fable 5.1 支持五个 effort 档位,低档位性能已与 Fable 5 高档位相当但成本更低。在 AutomationBench 上,得分从 17.1% 跃升至 31.4%。Mythos 5.1 在蛋白质设计中展示了 10 倍的结合亲和力提升,并将基因组学模型推理速度提高 1.4-2.5 倍。模型内置了符合欧盟 AI 法案的隐形水印和反蒸馏机制。API 标识符为 claude-fable-5-1,已在 AWS、Google Cloud 和 Azure 上线。
背景
Claude Fable 和 Mythos 是 Anthropic 的前沿模型系列;Fable 面向所有用户,而 Mythos 为经过审核的研究人员提供更宽松的安全护栏。Terminal-Bench-Science 衡量自主科研能力,AutomationBench 评估业务流程自动化,缓存读取定价对于需要反复引用大段上下文的智能体应用至关重要。数据留存政策一直是企业采用前沿模型的主要障碍。
社区讨论
社区反应不一:有人称赞模型性能,并指出切换 effort 档位不再破坏提示缓存;也有人抱怨使用限额过于严格(即使 Max 套餐也有 5 小时上限),并建议禁用 1M 上下文以节省 token。原帖作者对速率限制重置过快表示不满。
9月1日 18:30在 X 打开#AI #Anthropic #Claude #model release #benchmarks
028.0
OpenAI 的 Astra 模型在预备框架下达到关键网络安全阈值
OpenAI 宣布其即将发布的模型 Astra 已在预备框架下达到关键网络安全阈值。这意味着 Astra 能够在无需人工干预的情况下,在许多经过加固的现实关键系统中识别并开发功能性零日漏洞。该公司正在预览其评估方法、先进的安全防护措施以及持续学习的计划。 这是前沿模型首次公开披露达到关键网络安全阈值,标志着 AI 能力的重大升级。它引发了关于双重用途风险、负责任披露以及现有 AI 安全框架是否充分的紧迫问题。这一公告可能会影响围绕高能力 AI 模型的监管讨论和行业实践。 根据预备框架,当模型能够自主发现并武器化多个加固系统中的零日漏洞时,即达到关键网络安全阈值。OpenAI 尚未公开发布 Astra,评估细节在预览文档中提供。该框架于 2025 年 4 月更新,简化了等级并删除了“低”和“中”类别。公告还提到了提示缓存成本降低,但这与 Astra 的网络安全评估无关。
背景
OpenAI 的预备框架是一套用于评估和缓解日益强大的 AI 模型风险的指导方针。它定义了能力阈值,包括网络安全的“关键”级别,表明模型可能引入前所未有的严重危害新途径。该框架旨在在部署前系统评估模型,并随时间更新以反映不断演变的风险。零日漏洞是攻击者可以利用的先前未知的漏洞,自主发现此类漏洞是 AI 能力的一个重要里程碑。
9月1日 20:30在 X 打开#AI safety #OpenAI #cybersecurity #Preparedness Framework #Astra
037.0
阿里巴巴通义千问发布面向真实商业运营的 CommerceAgentBench 基准
阿里巴巴通义千问与 Accio 合作开源了 CommerceAgentBench,这是一个旨在评估 AI 智能体在真实商业运营中表现(而非仅回答问题)的基准。早期结果显示最佳整体完成率约为 62%,其中 Qwen3.8-Max 在所评估的开源权重模型中取得了最强的整体表现。 该基准填补了 AI 评估中的一个关键空白:大多数基准测试的是模型说了什么,而商业场景需要的是在长周期、有状态任务中的实际执行能力。通过提供可复现的高保真环境,CommerceAgentBench 有望加速电子商务及其他领域更强大智能体系统的开发。 CommerceAgentBench 包含 107 个有状态任务,分布在三个测试框架中,最高得分为 107 分中的 66 分。该基准已开源并托管在 GitHub 上,鼓励社区参与。早期结果被描述为“令人警醒”,表明即使是最优秀的模型在真实商业执行方面仍有很大的改进空间。
背景
AI 基准通常衡量模型回答问题或解决孤立任务的能力。然而,现实世界的商业活动涉及多步骤工作流、有状态交互以及搜索、比较、购买等执行动作。智能体商务(Agentic Commerce)指的是能够代表用户自主执行此类任务的 AI 智能体。开源权重模型是指参数公开可用的模型,开发者可以在本地运行和微调它们。
9月1日 04:21在 X 打开#AI benchmark #commerce agents #Qwen #open-source #LLM evaluation
047.0
从首帧准确提取视觉风格以复刻爆款AIGC视频
作者分享了一套复刻爆款AIGC视频的实操流程,重点在于从首帧中正确提取视觉风格。他们指出了一个常见误区:将一种风格误判为“水墨风”,而实际上它是带有剪纸元素的电影级二维数字插画。解决方案是使用近期热门的GitHub仓库awesome-gpt-image-2,通过迭代优化风格提取,并用提取出的提示词重新生成图片来验证效果。 准确的风格提取是制作爆款AIGC视频的隐性技术壁垒;许多创作者分享提示词,却不分享首帧的生成方法。这套流程通过提供可复现的方法降低了门槛,让更多创作者能够制作高质量、风格一致的视频。同时,它也凸显了prompt-as-code工具在智能体驱动的图像生成中日益增长的重要性。 作者最初使用“水墨风”作为视觉锚点,导致GPT Image 2生成结果出现大量噪点且视觉重心偏离。正确的风格被描述为“二维手绘东方幻想动画关键视觉”,具有平面化光影、剪影构图和特定的笔触规则。推荐的仓库awesome-gpt-image-2近期登顶GitHub Trending,提供prompt-as-code资产以实现稳定、可复用的图像生成。作者指出,即使使用该工具,也需要两到三轮提取和优化。
背景
AIGC(人工智能生成内容)视频创作常使用图生视频(I2V)模型,首帧定义了后续画面的视觉风格。风格提取是指分析一张图片,生成能够在新图片中重现该风格的文本提示词。GPT Image 2是OpenAI最新的图像生成模型,以高质量的文本渲染和风格一致性著称。GitHub Trending列出了在开发者中迅速流行起来的仓库。
9月1日 11:00在 X 打开#AIGC #video generation #style extraction #prompt engineering #tutorial
057.0
Mirobody:开源 AI 健康数据引擎统一碎片化健康数据
Mirobody 是一个开源 AI 健康数据引擎,旨在解决不同医院和可穿戴设备健康数据碎片化的问题。它从 Apple Health 和医疗文件等来源收集数据,并将其标准化为 FHIR R4、LOINC 和 UCUM 格式。该引擎支持 AI 问答,例如查询两年内糖化血红蛋白的变化趋势,并生成可视化图表和标注数据来源。 健康数据碎片化是使用 AI 进行个人健康分析的主要障碍,因为不同机构使用不同的格式和单位。通过将数据标准化为广泛采用的医疗互操作性标准,Mirobody 使 AI 模型能够准确解读和分析健康信息。这可以帮助个人更好地管理健康,并通过共享数据圈支持家庭照护。 Mirobody 的流程包括三个步骤:收集、标准化和 AI 问答。它支持 Apple Health 数据和多种医疗文件格式的自动解析。标准化将不同语言(中文、日文、英文、繁体中文)映射到相同的代码,对于未知术语宁可留空也不猜测。数据存储在本地,可通过 Docker 或 pip 配合大模型 API Key 进行部署。
背景
FHIR(快速医疗互操作性资源)是 HL7 International 制定的医疗信息电子交换标准。LOINC(逻辑观察标识符名称和代码)是用于标识健康测量、观察和文档的通用代码系统。UCUM(统一计量单位代码)为计量单位提供无歧义的代码,确保跨系统表示的一致性。这些标准广泛应用于医疗互操作性,以实现机器可读和可交换的健康数据。
9月1日 10:00在 X 打开#health-tech #open-source #AI #data-standardization #FHIR
067.0
tokentab:本地追踪 Claude Code、Codex 和 Gemini CLI 的 token 用量
tokentab 是一个新的开源命令行工具,它读取 Claude Code、Codex 和 Gemini CLI 留在磁盘上的会话日志,并按模型、项目和日期统计 token 用量与费用。它还会单独拆分 Claude 的缓存读写 token,避免重复计费,并提供一个完全本地运行的网页面板,无需账号或 API 密钥。 经常切换多个 AI 编码助手的开发者往往难以清楚了解自己的 token 消耗和费用。tokentab 通过本地读取日志提供准确指标,帮助用户管理预算、比较工具效率,无需依赖供应商仪表盘或第三方服务。 该工具解析 Claude Code、Codex 和 Gemini CLI 的 JSONL 会话日志,支持按模型、项目、日期和会话类型进行细分。它可以输出机器可读数据以便进一步处理,网页面板仅绑定本机端口,可离线使用,且不加载外部字体。GitHub 仓库地址为 https://github.com/damejan80/tokentab。
背景
Claude Code、Codex 和 Gemini CLI 等 AI 编码助手会在本地生成会话日志,其中包含请求和响应的详细数据,包括 token 数量。这些日志通常未被充分利用于成本分析。tokentab 利用这些现有数据提供跨工具的统一用量视图,解决了管理多个订阅的开发者常见的痛点。
9月2日 00:00在 X 打开#token tracking #AI coding assistants #developer tools #open source #cost management
077.0
OpenKB:把文档文件夹变成自动维护的 AI 维基
OpenKB 是 VectifyAI 推出的开源命令行工具,利用大语言模型将原始文档编译成结构化、互相链接的维基式知识库。它自动生成摘要、概念页和交叉链接,并标记文档之间互相矛盾的说法。该工具支持近 10 种文件格式,包括 PDF、Word、Excel、PPT 和网页链接,图表和图片也在检索范围内。 OpenKB 解决了 AI 辅助知识管理中的一个常见痛点:每次查询都从零开始重新推导,没有持久化的学习。通过将文档编译成随时间增长的维基,它让知识得以累积而不是重置,符合 Andrej Karpathy 关于知识库复利增长的设想。对于需要 AI 基于自有文档集合给出有据可查答案的开发者和研究人员来说,这很有价值。 OpenKB 由 PageIndex 的无向量、基于推理的长文档检索技术驱动,这与常见的向量嵌入方法不同。它会自动为人物、组织和产品创建专页,并允许用户通过链接追溯答案到源文档。该工具自带网页界面,上传、浏览和问答都在浏览器中完成。它是开源的,托管在 GitHub 的 VectifyAI 组织下。
背景
著名 AI 研究员 Andrej Karpathy 曾描述过一种由大语言模型驱动的知识库愿景:将原始信息编译成有组织、可搜索的维基,并随时间不断增长。传统的检索增强生成(RAG)系统通常在每次查询时检索相关段落,但不会持久化新知识。OpenKB 实现了这种编译并维护的方法,利用大语言模型从原始文档生成摘要、概念页和交叉链接。该工具基于 PageIndex 构建,这是一种避免向量嵌入、转而使用长文档推理的检索技术。
9月1日 13:30在 X 打开#AI #knowledge-management #open-source #RAG #tools
087.0
Inkeep 开源 OpenKnowledge:类 Notion 体验的 AI 原生 Markdown 编辑器
Inkeep 团队开源了 OpenKnowledge,这是一款 Markdown 编辑器,提供类似 Notion 的所见即所得编辑体验,同时文件始终以纯文本形式保存在本地磁盘。编辑器内置了 Claude、Codex 等 AI 助手,可直接在写作过程中调用,并支持文件导航、全文搜索和笔记关联图。团队共享和自动同步基于 git 实现,无需自建同步服务,并提供 macOS、Windows、Linux 安装包以及一键部署的网页版。 OpenKnowledge 回应了当今团队对既适合人类阅读、又能被 AI 智能体直接使用的文档和知识库的需求。它将类 Notion 的界面与本地优先的纯文本存储和基于 git 的同步相结合,降低了团队维护可被人类和 AI 编码代理共同编辑的活文档的门槛。这一做法顺应了“智能体文档”的趋势,即让 LLM 和编码助手直接消费和更新项目知识。 OpenKnowledge 完全免费且开源,代码仓库位于 github.com/inkeep/open-knowledge。开发团队将其形容为“Notion 遇上 VS Code”,强调精致编辑体验与开发者友好的纯文本和版本控制的结合。编辑器支持在工程文档中嵌入交互组件,既可以作为本地网页应用运行,也可以安装到主流桌面平台。虽然集成了 Claude 和 Codex,但提供的资料中并未详细说明 AI 功能的具体范围和限制。
背景
Inkeep 是一家以构建 AI 驱动的文档问答工具而闻名的公司,OpenKnowledge 是他们在 Markdown 编辑领域的开源贡献。Markdown 是一种轻量级标记语言,因采用纯文本且与 git 等版本控制系统配合良好而被开发者广泛用于文档编写。Notion 是一款流行的全能工作区工具,以其直观的块式编辑界面著称,许多用户认为它比原始 Markdown 更易上手。Git 是一种分布式版本控制系统,能够跟踪文件变更,天然适合文本文档的同步与协作。Claude 和 Codex 等 AI 编码助手是基于大语言模型的工具,可以生成、编辑和解释代码与文本,将其集成到编辑器中可在写作过程中提供实时帮助。
9月1日 07:30在 X 打开#open-source #markdown #AI #documentation #developer-tools
097.0
Tailscale 发布 tailcat:点对点文件传输工具
Tailscale 发布了 tailcat,这是一个开源的命令行工具和 Go 库,通过短连接令牌实现点对点文件传输。它利用 Tailscale 基于 WireGuard 的数据平面进行加密连接,并在直连失败时自动回退到 DERP 中继服务器。该工具无需账户、管理员权限或网络配置更改,还提供了基于浏览器的网页版本。 tailcat 解决了一个常见痛点:在设备之间传输大文件,无需依赖云存储或受大小限制。通过将 Tailscale 的点对点网络能力独立成一个工具,它让非技术用户也能轻松进行安全、直接的文件传输。其开源性质和知名团队的支持可能促进 P2P 文件共享领域的采用和进一步发展。 tailcat 以 Go 包和 CLI 形式构建,一端运行服务器(监听器)生成短令牌,另一端使用该令牌连接。直连通过 Tailscale 基于 WireGuard 的网状网络建立,但如果 NAT 穿透失败,流量将通过 Tailscale 的 DERP 服务器中继。浏览器演示目前完全通过 DERP 中继,因为浏览器在没有 WebRTC 的情况下无法进行直接点对点连接。Linux 和 Windows 均有安装包,该工具目前处于实验阶段。
背景
Tailscale 是一家以零配置 VPN 服务闻名的公司,该服务使用 WireGuard 创建安全的点对点网状网络。它简化了 NAT 穿透和设备间的加密连接。DERP(Detour Encrypted Routing Protocol)服务器是 Tailscale 的中继基础设施,在无法建立直接点对点连接时使用。tailcat 将这一核心网络能力提取为一个独立的文件传输工具,类似于 netcat,但内置加密和基于令牌的配对。
9月1日 04:00在 X 打开#file-transfer #tailscale #p2p #open-source #tool
107.0
超越模型推理:用分布式系统模式降低AI应用延迟
Bilgin Ibryam 分享了一份结构化的分布式系统模式清单,用于降低 AI 应用延迟,并强调模型推理只是关键路径的一部分。这些模式分为四类:局部性、工作缩减、并发执行和预判。该文章受 Pekka Enberg 的《Latency: Reduce Delay in Software Systems》一书启发,并链接到 generativeprogrammer.com 上的完整文章。 随着 AI 应用日益复杂,延迟越来越多地由非模型组件(如数据检索、编排和网络调用)主导。应用成熟的分布式系统模式可以在不修改模型本身的情况下显著提升性能。这种视角帮助工程师关注整个请求路径,从而构建响应更快、成本更低的 AI 系统。 这些模式包括:同地部署、复制、分区、缓存、算法级工作缩减、选择性数据处理、设置复用、请求合并、避免同步、独立并发、渐进式响应、并发预算、对冲请求、预测性预取、乐观更新、推测执行、预计算和预热。作者建议先追踪完整请求,然后应用能解决最大瓶颈的最小模式。完整文章可在 generativeprogrammer.com/p/latency-patterns-for-faster-ai-applications 查看。
背景
分布式系统模式是针对组件运行在多台联网计算机上的系统常见问题的可复用解决方案。在 AI 应用中,一个请求通常涉及多个服务(如模型推理、向量数据库、特征存储、外部 API),延迟在这些环节中累积。文中提到的模式在分布式计算中已经成熟,现在正被适配到 AI 技术栈中。Pekka Enberg 的《Latency: Reduce Delay in Software Systems》一书对降低延迟的技术进行了全面阐述。
9月1日 09:48在 X 打开#AI #latency #distributed-systems #performance #patterns
117.0
用AI智能体构建自改进产品的框架
@realmadhuguru 的推文概述了构建自改进产品的五部分框架:定义指标、阐述策略、维护过去决策的知识库、连接内部产品系统,以及为端到端开发流程构建一个执行框架。该推文引用了 Amplitude 的 Wave 智能体,该智能体已在 Amplitude 自己的产品上运行,能够发现问题、发布修复并衡量结果。 自改进产品代表了从被动到主动产品开发的转变,AI 智能体持续监控指标并自主实施改进。这可以显著加快迭代周期并减少产品管理的人工开销,影响整个行业的产品团队。 该框架包括五个核心组件:清晰的指标定义(主要、次要、护栏)、策略阐述、过去决策的知识库、与内部系统(仪表板、API、MCP、工具)的连接,以及开发流程的执行框架。推文建议,对于较简单的产品,团队可以使用这些组件的基础版本进行原型设计,并重用现有的 SWE 智能体。Amplitude 的 Wave 智能体是一个真实世界的实现,已在 Amplitude 自己的产品上运行了数月。
背景
自改进产品是使用 AI 智能体自动检测问题、实施修复并衡量变更影响的系统。SWE 智能体(软件工程智能体)是基于大语言模型的系统,能够通过结合推理和工具使用来自主解决软件任务。MCP(模型上下文协议)是将 AI 助手连接到外部工具和数据源的标准,使智能体能够观察和操作产品系统。Amplitude 是一家产品分析公司,推出了 Wave,一个体现这些概念的主动式产品智能体。
9月1日 16:01在 X 打开#AI agents #product development #self-improving systems #metrics #automation
127.0
Effect 成为 TypeScript 后端开发的必备库
知名 TypeScript 教育者 Matt Pocock 公开表示 Effect 已成为 TypeScript 后端开发的必备库,并同意 Dillon Mulroy 的观点:今后不会再在没有 Effect 的情况下启动任何 TypeScript 项目。这标志着从过去“用 TS 而不是 JS”的建议,转变为“用 Effect 而不仅仅是 TS”。该认可提到了 Effect 的广泛采用、对 AI 代理的助力以及 Cloudflare 支持。 这一认可标志着 TypeScript 后端最佳实践可能发生转变,因为 Effect 提供了类型化错误、依赖注入和可组合并发,解决了大型应用中的常见痛点。如果 Effect 成为默认选择,将改变团队组织后端代码的方式,并影响招聘和库生态系统。提到对 AI 代理的助力,表明 Effect 可能特别适合 AI 驱动的开发工作流。 Effect 是一个 TypeScript 库,为生产级应用提供数据结构、工具和模式的标准库,包括类型化错误和依赖注入。根据 Mulroy 的说法,它已经达到了“足够关键的采用率”,并且提供了“出色的 Cloudflare 支持”,这对于无服务器和边缘部署很重要。该库是开源的,可在 GitHub 上的 Effect-TS/effect 获取。
背景
TypeScript 是 JavaScript 的超集,增加了静态类型,广泛用于前端和后端开发。Effect 是一个相对较新的库,旨在为 TypeScript 提供标准库,提供函数式编程模式,如类型化错误、依赖注入和结构化并发。从“用 TS”到“用 Effect”的转变反映了生态系统的成熟,开发者寻求更健壮的抽象来处理复杂的后端系统。Cloudflare 支持值得注意,因为许多 TypeScript 后端部署在 Cloudflare Workers(一个无服务器平台)上。
9月1日 18:32在 X 打开#TypeScript #Effect #backend #developer-tools #trends