- 论文揭示从前沿AI API提取隐藏推理的方法8.0
- OpenAI 发布 Linux 版 ChatGPT 桌面应用预览8.0
- Anthropic将于2026年8月起在所有Claude生成文本中嵌入隐形水印8.0
- Kimi K3 开源模型现已在 Databricks 上通过 Unity AI Gateway 提供8.0
- LangChain 基准测试:30B 模型与 Claude Opus 4.8 路由降低智能体成本 70%8.0
- 仅看Token花费是误导性的AI效率指标7.0
- Anthropic 的 Sonnet 在 2026 年面临 GLM 5.2、Kimi K3 和 GPT Luna 的定价压力7.0
- 优化 AGENTS.md 以提升 AI 编程代理性能7.0
- Codex 技能从照片生成抽象面板且不改变原图7.0
- Code-Graph-RAG:通过知识图谱实现代码库的自然语言查询7.0
- OpenMinis 为手机带来完整 Linux 环境,赋能 AI Agent7.0
- AI Agent Skill 自动生成沉浸式 3D 滚动落地页7.0
018.0
论文揭示从前沿AI API提取隐藏推理的方法
一篇新论文展示了前沿AI API中的一个漏洞,允许提取隐藏的推理轨迹,而不仅仅是最终答案。这使得高密度推理蒸馏成为可能,学生模型可以从教师模型的完整思维链中学习。该方法在大多数提示中已验证与计费的API思考令牌1:1匹配。 该技术通过提供更丰富的训练数据,可能显著降低训练高级推理模型的成本和努力。它还为系统性提取闭源模型输出的指控增加了技术分量,特别是在中国AI发展的背景下。这些发现可能迫使前沿实验室重新考虑API安全和水印策略。 该攻击利用了每个前沿AI公司API中存在的漏洞,能够重建加密的推理轨迹。论文附录B显示,注入少量Opus或GPT-5.6 Sol推理片段会导致Kimi-K3和GLM-5.2的输出向源模型偏移,而DeepSeek模型未表现出相同效果。然而,没有公开证据表明此类蒸馏轨迹已进入特定模型训练集,也无法量化闭源模型对中国开源模型性能的贡献。
背景
模型蒸馏是一种技术,通过使用教师模型的输出作为训练数据,训练较小的“学生”模型模仿较大的“教师”模型。推理蒸馏专门针对思维链过程,即模型在最终答案前生成中间步骤。像Anthropic和OpenAI这样的前沿AI公司提供其模型的API访问,但通常隐藏内部推理令牌以保护知识产权。文本水印是一种通过使用密钥微妙地偏向词语选择来检测AI生成内容的方法,允许统计检测水印。
社区讨论
推文线程包含对文本水印的详细解释,指出虽然水印可以通过改写被破解,但它们作为欧盟AI法案等法规的合规措施。评论者承认水印并非万无一失,但对大多数用户和监管机构来说已足够。
8月11日 23:39在 X 打开#AI security #model distillation #frontier models #reasoning extraction #Anthropic
028.0
OpenAI 发布 Linux 版 ChatGPT 桌面应用预览
OpenAI 发布了 Linux 版 ChatGPT 桌面应用的预览版本,将包括 Codex 在内的完整 ChatGPT 体验带给 Linux 用户。该应用支持 Ubuntu 24.04 LTS 和 26.04 LTS、Debian 13、Fedora 43 和 44,提供适用于 x64 和 ARM64 架构的 .deb 和 .rpm 安装包。 这一发布填补了重要空白,Linux 是最后一个缺少原生 ChatGPT 应用的主要桌面平台。它使依赖 Linux 的开发者和用户能够将 ChatGPT 和 Codex 无缝集成到工作流程中,有望提高生产力并推动 Linux 上 AI 辅助编程的普及。 预览版支持特定的 Linux 发行版:Ubuntu 24.04 LTS 和 26.04 LTS、Debian 13、Fedora 43 和 44。安装包以 .deb 和 .rpm 格式提供,适用于 x64 和 ARM64 架构。应用包含 ChatGPT、ChatGPT Work 和 Codex,可从 openai.com/codex 下载。
背景
ChatGPT 是 OpenAI 的对话式 AI 助手,Codex 则是一个帮助完成软件工程任务的 AI 编程代理。此前,ChatGPT 桌面应用仅支持 Windows 和 macOS,Linux 用户只能依赖网页版或第三方客户端。Linux 社区长期以来一直呼吁推出原生应用,此次预览标志着 OpenAI 对该平台的官方支持。
社区讨论
该公告受到了热烈欢迎,用户们表示终于不用为了原生 ChatGPT 体验而考虑切换到 macOS 了。一些人开玩笑说要取消 MacBook 的订单,凸显了 Linux 社区的强烈需求。
8月11日 19:05在 X 打开#OpenAI #ChatGPT #Linux #Codex #Desktop App
038.0
Anthropic将于2026年8月起在所有Claude生成文本中嵌入隐形水印
Anthropic宣布,从2026年8月2日起,所有Claude模型生成的文本都将包含直接嵌入内容的隐形水印。该水印在复制、粘贴和部分编辑后仍会保留,公司还将推出文本检测API以帮助识别AI生成的文本。此举是为了遵守欧盟《人工智能法案》的透明度要求。 这一进展为识别AI生成文本提供了实用工具,回应了人们对错误信息和内容真实性的日益担忧。它为其他AI实验室树立了先例,可能在监管压力下成为行业标准。检测API可集成到GitHub等平台,用于验证代码或内容是否由AI生成,从而增强信任和问责。 水印不可感知且不影响文本质量,但存在局限性——可能无法在大量编辑或翻译后保留。Anthropic仍在努力为现有模型添加水印,该要求适用于2026年8月2日及之后发布的模型。部署范围是全球性的,不限于欧盟。检测API将允许用户自行检查文本,例如验证拉取请求是否由Claude Code生成。
背景
欧盟《人工智能法案》,特别是第50条,要求对AI生成内容进行透明度处理,包括水印和标签,截止日期从2026年8月2日开始。隐形水印将一种模式嵌入文本中,可通过算法检测但对人类不可见。Anthropic的方法类似于谷歌用于图像的SynthID,但应用于文本。其他AI公司预计将采取类似措施以遵守该法案。
8月11日 19:21在 X 打开#AI safety #Anthropic #watermarking #EU AI Act #AI detection
048.0
Kimi K3 开源模型现已在 Databricks 上通过 Unity AI Gateway 提供
月之暗面(Moonshot AI)的 Kimi K3 模型(2.8 万亿参数混合专家开源模型)现已在 Databricks 上通过 Unity AI Gateway 上线。企业现在可以在其现有的 Databricks 环境中部署 Kimi K3,并利用 Unity Catalog 进行治理和安全控制。该模型可与其他前沿模型一起使用,无需更改应用程序代码。 这是企业 AI 应用的重要一步,因为 Kimi K3 以更低的推理成本提供了前沿级别的性能,运行效率比闭源替代方案高 2-3 倍。通过与 Databricks 集成,企业可以直接在其受管控的数据湖仓上构建自定义 AI 应用和智能体。此举加剧了开源模型领域的竞争,对 OpenAI 和 Anthropic 等闭源提供商构成挑战。 Kimi K3 是一个 2.8 万亿参数的 MoE 模型,其权重已公开发布,允许无限制下载、自托管和适配。在 Databricks 上,它通过 Unity AI Gateway 提供服务,该网关提供企业级访问控制、成本监控和性能扩展。用户可以通过单一 API 测试 Kimi K3 和其他模型,无需更改代码。该模型在推理的每一层都进行了优化,以降低开销和成本。
背景
月之暗面是一家中国人工智能公司,以其 Kimi 系列大语言模型而闻名。像 Kimi K3 这样的开源模型公开提供模型参数,允许开发者在自己的基础设施上进行微调和部署。Databricks 是一个基于湖仓架构的统一数据和 AI 平台,融合了数据湖和数据仓库。Unity AI Gateway 是 Databricks 内的治理层,基于 Unity Catalog 构建,用于管理和保护 AI 模型交互。混合专家(MoE)是一种模型架构,每次输入只激活部分参数,从而提高效率。
8月11日 08:20在 X 打开#AI #Open-Weight Models #Databricks #Enterprise AI #Kimi K3
058.0
LangChain 基准测试:30B 模型与 Claude Opus 4.8 路由降低智能体成本 70%
LangChain 使用其包含 145 个多步骤任务的 Deep Agents 评估套件,测试了 NVIDIA 的开源路由器 Switchyard。结果显示,93% 的步骤由 30B 模型处理,仅 7% 需要 Claude Opus 4.8。这种路由方法将总成本降低了约 70%,同时保持了 Opus 约 90% 的准确率。 这表明并非所有智能体任务都需要昂贵的前沿模型,从而在不显著降低性能的情况下大幅节省成本。它使预算有限的开发者和企业更容易使用先进的 AI 智能体。该方法符合行业向高效模型路由和分层部署策略发展的趋势。 该基准测试使用了 NVIDIA 的 Switchyard,这是一个开源路由器,可根据能力、成本和延迟为每个步骤选择模型。30B 模型处理了大部分任务,Opus 4.8 仅用于复杂步骤。评估涵盖工具使用、检索、文件系统操作和长上下文。该集成可用于 LangChain 的 Deep Agents。
背景
LangChain 是一个流行的框架,用于构建基于大语言模型的应用。Deep Agents 是复杂的 AI 系统,可使用工具和记忆执行多步骤任务。模型路由根据每个请求动态选择最合适的大语言模型,以平衡性能和成本。NVIDIA 的 Switchyard 是一个用于路由 AI 智能体工作负载的开源库。像 Claude Opus 4.8 这样的前沿模型能力强大但昂贵,而较小的模型(如 30B 参数)更便宜、更快。
8月11日 16:30在 X 打开#LLM #AI agents #model routing #cost optimization #LangChain
067.0
仅看Token花费是误导性的AI效率指标
@dotey 转推 @mtrainier2020 的推文指出,仅凭Token花费来衡量AI使用情况没有参考价值。它批评了从英伟达和Meta延续而来的“token maxxx”思维,并提倡一种高性价比策略:复杂任务用Fable等高端模型,中等任务用GLM、DeepSeek等,简单任务用本地模型,并结合缓存来控制成本。 这一观点挑战了当前盛行的“token maxxxing”文化,即认为Token消耗越多生产力越高。它强调了战略性模型选择和成本优化的重要性,这可以带来比普通员工高得多的投资回报率。对于采用AI的组织来说,这一讨论很有意义,因为它指出了常见误区,如过度依赖昂贵模型以及无限Token预算的收益递减。 推文引用了一项实验:给一个20多人的团队100万美元预算不限量使用AI Token,结果成本比人力还高,且效率提升有限。它指出Anthropic的Fable模型API价格为输入每百万Token 10美元、输出每百万Token 50美元,不加控制地使用会极其昂贵。作者建议通过将任务分配给合适的模型并使用缓存,Token使用量和成本可以控制得很好。
背景
“Token maxxxing”是2026年左右在硅谷出现的一个术语,指将最大化AI Token消耗作为衡量工程生产力的指标,由Meta等公司推广。Token是AI模型处理文本的基本单位,不同模型的成本差异很大。像Claude Fable 5这样的高端模型非常昂贵,而DeepSeek、GLM等国产模型价格低得多,这使得分层使用策略在经济上很有吸引力。
8月11日 05:24在 X 打开#AI cost #token usage #LLM #cost optimization #AI strategy
077.0
Anthropic 的 Sonnet 在 2026 年面临 GLM 5.2、Kimi K3 和 GPT Luna 的定价压力
@xleaps 发布并由 @dotey 转推的一条推文分析了 2026 年 Anthropic 的 Sonnet 模型面临的竞争格局。推文称,尽管 Sonnet 在 2026 年上半年作为编程子代理领先,但到下半年,GLM 5.2、Kimi K3 和 GPT Luna 等竞争对手将挑战其主导地位。分析特别指出,Sonnet 的分词器效率低下导致 token 用量凭空增加 40%,使其在价格上毫无竞争力。 据报道,Sonnet 是 Anthropic 利润率最高的模型,因此失去定价权可能会严重影响公司的年度经常性收入(ARR)。该预测表明,如果 Sonnet 无法维持定价,Anthropic 的 ARR 可能会在年中达到顶峰后下降。这凸显了 AI 模型市场竞争的加剧,定价和效率正成为关键差异化因素。 推文提到,Anthropic 已将 Sonnet 5 的引入价格永久定为每百万输入 token 2 美元和每百万输出 token 10 美元。然而,分词器效率低下实际上增加了用户的成本。预计 GLM 5.2、Kimi K3 和 GPT Luna 等竞争对手将提供更具竞争力的价格,给 Sonnet 的市场地位带来压力。
背景
Anthropic 的 Sonnet 是一个以编程能力著称的大型语言模型,常被用作开发工作流中的子代理。子代理是一种专门的 AI 助手,拥有自己的上下文窗口和工具,专为特定任务设计。分词器效率是指模型将文本分解为 token 的方式;低效的分词器会为相同输入使用更多 token,从而增加成本。GLM 5.2、Kimi K3 和 GPT Luna 是来自其他 AI 实验室的竞争模型,其中 GLM 5.2 专注于长周期任务,Kimi K3 是一个大型开源模型。
8月11日 02:58在 X 打开#AI #Anthropic #Sonnet #competition #pricing
087.0
优化 AGENTS.md 以提升 AI 编程代理性能
Matt Pocock 分享了一份关于构建 AGENTS.md 文件以提升 AI 编程代理性能的指南。该指南强调使用聚焦的指令和渐进式披露,避免让代理不堪重负。它提供了组织文档的实用建议,以提高可维护性和代理输出质量。 随着 AI 编程代理日益普及,优化其上下文文件直接影响开发效率。结构良好的 AGENTS.md 可以减少错误并改善代码生成,使依赖 Cursor 或 Copilot 等工具的开发者受益。这满足了 AI 辅助开发中对最佳实践日益增长的需求。 该指南建议保持指令聚焦,并使用渐进式披露仅在需要时揭示复杂性。它建议用清晰的章节组织 AGENTS.md,避免信息过载。该方法兼容任何读取项目级指令的 AI 编程代理,格式为纯 Markdown,无严格规则。
背景
AGENTS.md 是一种开放格式文件,放在项目根目录中,为 AI 编程代理提供指令和上下文。它就像 AI 的 README,帮助 GitHub Copilot 或 Cursor 等工具理解代码库。渐进式披露是一种设计原则,先呈现基本信息,按需揭示细节,以减少认知负担。该指南由知名开发者倡导者 Matt Pocock 编写,旨在标准化开发者与 AI 代理的沟通方式。
8月11日 13:19在 X 打开#AI coding agents #AGENTS.md #developer tools #documentation #AI-assisted development
097.0
Codex 技能从照片生成抽象面板且不改变原图
一个名为 photo-abstract-editorial 的新 Codex 生成技能问世。它接收一张照片,在下方生成极简抽象面板,完全保留原图。抽象面板源自照片的空间结构、构图和色彩关系,并配有一行诗意英文标题。 该工具为希望增添艺术感但不想使用滤镜或让 AI 重绘图像的摄影师提供了一种新颖的创意方法。它连接了摄影与抽象艺术,让用户在保持原图完整性的同时探索新的视觉表达。这可能催生一种混合视觉内容的新流派。 抽象面板中的每个元素都追溯到原图的真实结构,因此它既不是滤镜也不是风格迁移。用户可以调整照片比例、面板风格和色彩倾向。该技能已在 GitHub 上发布,地址为 http://github.com/ZzzLc0405/photo-abstract-editorial。
背景
Codex 是一个能够生成代码和自动化任务的 AI 系统。“Codex 技能”是可复用的模块,用于扩展 Codex 在特定工作流中的能力,通常通过 GitHub 等平台分享。抽象艺术使用形状、色彩和形式来达到效果,而不直接描绘视觉现实。在数字图像处理中,滤镜应用预设调整,而风格迁移则使用 AI 将一幅图像的风格应用到另一幅上,通常会改变原始内容。
8月12日 00:00在 X 打开#AI #photography #creative tool #GitHub #image processing
107.0
Code-Graph-RAG:通过知识图谱实现代码库的自然语言查询
Code-Graph-RAG 是一个新的开源工具,它将代码库解析为函数、类和模块的知识图谱,并将关系存储在图数据库中。它支持对十多种语言(包括 Python、TypeScript、Rust、Go、Java 和 C/C++)的代码进行自然语言查询和编辑。该工具还可作为 MCP 服务器运行,让 Claude Code 和 Codex 等 AI 代理直接查询和修改代码库。 该工具通过允许开发者用自然语言询问代码关系,显著减少了在大型复杂代码库中导航的时间。它还支持 AI 辅助重构、死代码检测和结构化搜索替换,从而提升生产力和代码质量。通过支持 MCP,它无缝集成到新兴的 AI 编码代理生态系统中。 Code-Graph-RAG 使用 Tree-sitter 进行多语言解析,并将图谱存储在 Neo4j 中。它通过 MCP 提供 15 个工具,用于查询、搜索、编辑和优化代码。该工具可以检测死代码、建议优化,并在应用更改前显示差异。它在 MIT 许可证下开源,可在 GitHub 上获取。
背景
在大型软件项目中,理解函数和模块之间的相互联系是一项挑战。传统的 grep 或 IDE 搜索往往无法捕捉语义关系。知识图谱表示实体及其关系,支持复杂查询。检索增强生成(RAG)将信息检索与语言模型相结合,提供上下文感知的答案。模型上下文协议(MCP)是 Anthropic 推出的开放标准,允许 AI 模型以标准化方式与外部工具和数据源交互。
8月11日 13:30在 X 打开#code-graph #RAG #developer-tools #knowledge-graph #MCP
117.0
OpenMinis 为手机带来完整 Linux 环境,赋能 AI Agent
OpenMinis 是一款新发布的开源应用,可在 iOS 和 Android 设备上提供完整的 Alpine Linux 沙箱环境。它让 AI Agent 能够直接在手机上安装软件、运行脚本和管理文件。该应用还打通了健康、日历、提醒事项和 HomeKit 等 iOS 系统功能,使 Agent 能执行系统级任务。 该工具弥合了移动平台与 AI Agent 之间的鸿沟,在智能手机上实现了复杂的自动化和本地优先的 AI 工作流。它让用户能够利用 AI 进行个人生产力管理、健康追踪和智能家居控制,而无需依赖云服务。其开源特性和跨平台支持可能催生新的移动 AI Agent 应用生态。 OpenMinis 在 iOS 上使用 iSH、在 Android 上使用 PRoot 来提供 Linux 环境,并自行编译了 FFmpeg 等依赖项。它支持通过用户提供的 API 密钥接入 Claude、GPT、Gemini 等主流 AI 模型。该应用免费、开源(GNU GPL v3.0),代码托管在 GitHub 上。它被设计为 Claude Cowork 和 OpenClaw 等工具的移动优先替代方案。
背景
AI Agent 是能够通过工具和 API 自主执行任务的软件程序。在移动设备上,它们传统上受限于沙盒化的操作系统,文件系统访问和跨应用通信受到限制。OpenMinis 通过在应用内嵌入轻量级 Linux 发行版(Alpine Linux)来绕过这些限制,提供熟悉的命令行环境。iSH 是一款在 iOS 上模拟 Linux shell 的应用,而 PRoot 是 Android 上用户态的 chroot 实现。这种方法使 AI Agent 能够执行任意代码,并访问通常对移动应用封闭的系统功能。
社区讨论
推文重点提到了 MacStories 的 Federico Viticci 的正面评价,称其为近期印象最深的独立应用之一。社区兴趣浓厚,分享了许多创意用例,如自动将餐食记录到 Apple Health,以及将 X 时间线生成为早晨语音播报。开源特性和跨平台支持广受好评,但也有人可能对在手机上运行完整 Linux 环境的实用性存疑。
8月11日 10:00在 X 打开#AI Agent #Open Source #Mobile #Linux #iOS
127.0
AI Agent Skill 自动生成沉浸式 3D 滚动落地页
开源项目 scroll-world 推出了一种 AI Agent Skill,可生成沉浸式 3D 滚动驱动落地页。它能自动创建微缩 3D 场景,并利用视频模型生成无缝的镜头飞行过渡效果。输出为框架无关的原生 JavaScript,并额外提供 9:16 竖版移动端版本。 传统上,制作电影级 3D 滚动体验需要大量专业知识和时间,涉及视觉设计、视频生成和网页动画。该工具大幅降低了门槛,使开发者和品牌能快速制作出高冲击力的落地页。它顺应了 AI 辅助创意工作流的趋势,有望让高级网页设计更加普及。 滚动引擎为纯原生 JS,可嵌入普通 HTML、Next.js 或 Vue 页面。它先生成微缩 3D 场景,再用视频模型实现镜头过渡,滚动控制时间轴。还会额外渲染 9:16 竖版,针对竖屏重新构图。项目托管在 GitHub,用户名为 oso95。
背景
Agent Skill 是一种轻量级开放格式,通过 SKILL.md 文件为 AI 代理扩展专业知识和流程。滚动驱动 3D 落地页利用用户滚动来控制镜头在 3D 场景中移动,营造电影级叙事效果。传统上,构建这类页面需要深入掌握 WebGL、Three.js 和 GSAP 等动画库,且耗时费力。
8月11日 07:30在 X 打开#AI #Web Development #3D #Landing Page #Agent Skill