- Cursor 推出 AI 原生代码托管平台 Origin8.0
- Cumora:让 AI Agent 成为聊天群正式成员的开源平台8.0
- DeepSeek Harness 突破 15 万 Star,精选插件列表发布7.0
- Windows-Use:通过 UI API 实现大模型驱动的 Windows 图形界面自动化7.0
- codesight 预编译代码库为文档,大幅降低 AI 上下文消耗7.0
- ZIZIYI Office:开源浏览器办公套件,零上传编辑 Office 文件7.0
- 分享精选的40多条Claude Code技巧仓库7.0
- Monday.com 的 Sidekick AI 助手使用 LangSmith 沙箱处理复杂任务7.0
- LangChain 与 AWS 推出 AgentCore 支付中间件,实现代理自主支付 API 费用7.0
- AI模型是否被故意变笨?7.0
- Protobuf 通过 Buf 获得语言服务器协议支持7.0
- 从真实用户轨迹构建LLM评估的实用指南7.0
018.0
Cursor 推出 AI 原生代码托管平台 Origin
Cursor 正式推出其自有代码托管平台 Origin,用户可以从 GitHub 同步仓库开始使用。Origin 集代码存储、Git 托管、代码审查和团队协作于一体,但其设计前提与 GitHub 不同:从一开始就将 AI Agent 作为主要用户。该平台基于 Cursor 于 2025 年底收购的 Graphite 团队技术构建,目前已在所有付费计划中开启早期测试。 此次发布标志着 Cursor 纵向整合战略的重要一步,将编辑器、云端智能体、代码审查和代码托管闭环在一个产品内。它直接挑战 GitHub 的主导地位,解决了多个 AI 智能体在仓库中并行工作时出现的性能瓶颈。对于已经在使用 Cursor 云端智能体的开发者来说,Origin 有望让从代码生成到合并的整个流程无需离开 Cursor 环境。 在 Compile 大会的演示中,Origin 在单个仓库内实现了每秒 22.6 次提交、每小时 29.6 万次克隆、全球同步延迟低于 400 毫秒,并内置了 AI 驱动的自动合并冲突解决功能。该平台初期先上线代码审查功能,再逐步迁移托管功能,以降低用户从 GitHub 切换的门槛。Origin 目前处于早期测试阶段,所有付费 Cursor 计划均可使用,第一步是从 GitHub 同步仓库。
背景
GitHub 是主流的代码托管平台,其设计围绕人类工作流程,采用顺序合并和有限的审查者数量。Cursor 是一款 AI 驱动的代码编辑器,因其与 AI 模型的深度集成而广受欢迎。Cursor 收购的 Graphite 是一款用于管理堆叠式拉取请求的工具,它允许多个有依赖关系的代码变更并行处理,这种工作方式与 AI 智能体的运作模式高度契合。Origin 是 Cursor 尝试构建的一个针对 AI 驱动开发的高并发和速度需求进行优化的托管平台。
8月17日 18:01在 X 打开#Cursor #AI coding #code hosting #Git #developer tools
028.0
Cumora:让 AI Agent 成为聊天群正式成员的开源平台
yetone 开源了 Cumora,一个将 AI Agent 变成团队对话正式成员的聊天平台。Agent 拥有名字、人设和记忆,可以发私聊、建群、认领任务,甚至收发真实邮件。项目支持两种部署方式:Cumora Cloud(Agent 运行在云端托管的 Kubernetes Pod 中,使用 OpenAI 的 Responses API 驱动)和 BYOA(自带 Agent,通过 `npx cumora agent computer` 在本地运行,使用你自己的 Claude Code 或 Codex CLI 订阅)。 Cumora 解决了多智能体系统中的一个关键挑战:协调与冲突避免。通过赋予 Agent 持久的身份、记忆和共享工作空间,它实现了更自然的人机协作,并降低了响应冲突或信息过时的风险。BYOA 选项对于希望使用自己的模型订阅、且不将 API 密钥暴露给第三方服务器的开发者来说意义重大。 Cumora 包含一套协调机制:拦截基于过时信息的回复、使用原子任务认领防止重复工作,以及一个轻量级分诊层来决定何时唤醒大模型。默认团队包括 Atlas(研究员)、Bram(工程师)、Iris、Nova 和 Saga 等角色。项目目前处于邀请制内测阶段,可在 cumora.ai 使用 Google 或 GitHub 账号申请。项目已在 GitHub(yetone/cumora)完全开源,支持使用 Postgres 和 Redis 本地部署,桌面端支持 macOS、Windows 和 Linux,iOS 移动端正在计划中。
背景
多智能体系统涉及多个 AI Agent 协同工作,常常面临协调问题,例如 Agent 基于过时信息回复或重复执行任务。现有的解决方案如 AutoGen 和 CrewAI 侧重于编排框架,而 Cumora 采用聊天优先的方式,将 Agent 直接嵌入熟悉的团队沟通界面中。BYOA(自带 Agent)是一种用户提供自己的 AI 模型凭证的模式,密钥保留在本地,减少了对供应商的锁定。该项目由 yetone 创建,他是一位以其他开源工具而闻名的开发者。
8月17日 17:32在 X 打开#AI agents #multi-agent collaboration #open source #chat interface #coordination
037.0
DeepSeek Harness 突破 15 万 Star,精选插件列表发布
开源项目 DeepSeek Harness 发布后不久,GitHub 星标数迅速突破 15 万。社区随即推出了 awesome-dsh-plugin,这是一个精选插件合集,所有插件均可通过一条命令直接安装。该合集按用途分为十几个类别,包括界面增强、用量统计、主题外观、模型接入、记忆和通知等。 星标数迅速突破 15 万,表明社区对 DeepSeek Harness 作为 AI 智能体基础框架的浓厚兴趣和广泛采用。精选插件列表降低了扩展该框架的门槛,使开发者无需从零构建即可轻松添加功能。这种生态系统的势头可能加速基于 DeepSeek 模型的生产级智能体系统的开发。 awesome-dsh-plugin 仓库以英文、中文和日文三种语言维护,收录标准和评审清单均公开在仓库中。新闻提到插件描述声称有 46 个工具,并有人工核对确认了数量。此外还配套了一个插件市场,用户可以在 DeepSeek Harness 内一键安装插件和切换主题。网络搜索结果显示,该精选列表已增长到 90 多个插件,其中 dsh-web-ui 等个别插件已有数千星标。
背景
DeepSeek Harness 是一个开源框架,定位为 DeepSeek 大语言模型与生产级 AI 智能体之间的中间层,遵循“模型 + 框架 = 智能体”的理念。该项目星标数的快速增长反映了开发者对构建智能体应用所需的模块化、可扩展工具的广泛需求。“一切皆插件”的架构允许用户在不修改核心系统的情况下添加界面增强、记忆和模型集成等功能。像 awesome-dsh-plugin 这样的精选列表在开源社区中很常见,用于帮助用户发现高质量的扩展。插件市场则进一步简化了安装和主题管理。
8月18日 00:00在 X 打开#DeepSeek #open-source #plugins #GitHub #AI tools
047.0
Windows-Use:通过 UI API 实现大模型驱动的 Windows 图形界面自动化
Windows-Use 是一个新的开源工具,它利用原生 UI 自动化 API(而非基于截图的视觉识别)让大语言模型直接控制 Windows 图形界面。它接受简单的自然语言任务描述,并自主规划和执行打开窗口、点击、输入、拖拽等操作。该工具支持 Claude、GPT、Gemini 以及通过 Ollama 接入的本地模型,并兼容 Windows 7 到 11。 该方法解决了 GUI 自动化的一个主要痛点:基于屏幕坐标或图像的脚本在界面变化时容易失效。通过直接从系统的 UI 自动化接口读取控件名称和位置,Windows-Use 提供了更稳健、更易维护的解决方案。它还将成熟的 UI 自动化技术与大模型推理相结合,降低了企业环境中常见的遗留 Windows 应用程序的自动化门槛。 该工具使用 Windows UI 自动化 API 获取控件信息,比视觉方法更可靠。它还可以运行系统命令、读写文件、切换虚拟桌面,并支持语音输入/输出。GitHub 仓库地址为 http://github.com/Jeomon/Windows-Use。推文中未提供定价或许可证信息。
背景
Windows UI 自动化(UIA)是一个辅助功能框架,它向辅助技术和自动化工具公开 UI 元素的结构和属性。与基于截图的方法不同,UIA 提供对控件名称、类型和位置的编程访问,使自动化更加稳健。大语言模型(LLM)可以解释自然语言指令并生成操作序列,与 UIA 结合后,无需硬编码脚本即可控制应用程序。Ollama 是一个用于在本地运行 LLM 的工具,提供隐私和离线能力。
8月17日 13:30在 X 打开#LLM #Windows Automation #GUI Automation #Open Source #AI Agents
057.0
codesight 预编译代码库为文档,大幅降低 AI 上下文消耗
codesight 是 Houseofmvps 推出的新开源工具,可将代码库预编译为涵盖路由、数据和模块关系的结构化文档。它完全使用静态分析而非大模型调用,约 200 毫秒即可生成结果,且无 API 开销。该工具还能生成 CLAUDE.md 和 AGENTS.md 文件,并兼容 Cursor 和 Codex。 这解决了 AI 辅助编程中的一个常见痛点:AI 助手在执行简单任务时常常扫描整个项目,消耗大量上下文。通过提供紧凑的预构建索引,codesight 让 AI 以极少的 token 开始新会话,可能显著节省成本并提高效率,尤其适用于大型代码库。 codesight 可作为 MCP 服务器运行,提供 13 个专用工具,让 AI 助手按需查询特定元数据。它支持 --watch 模式,在代码变更时自动重新生成文档。该方法灵感来自 Karpathy 的 LLM wiki 概念,但直接从代码分析中提取结构,而非依赖模型总结。
背景
Claude Code、Cursor 和 Codex 等 AI 编程助手通常需要读取代码库的大部分内容来理解上下文,这会消耗 token 并增加成本。静态分析在不执行代码的情况下检查代码,高效提取结构和关系。Karpathy 的 LLM wiki 理念提出将知识预编译为适合上下文窗口的紧凑索引,以便快速检索相关信息。
8月17日 10:00在 X 打开#AI-assisted development #code documentation #context optimization #developer tools #LLM
067.0
ZIZIYI Office:开源浏览器办公套件,零上传编辑 Office 文件
ZIZIYI Office 是由开发者 baotlake 开发的开源在线办公套件,于 2026 年 1 月公开发布,采用 AGPL 许可证。它利用 WebAssembly 技术,在浏览器中直接编辑 Word(.docx)、Excel(.xlsx)和 PowerPoint(.pptx)文件,全程无需将文件上传到任何服务器。该工具还集成了 Google Drive、Dropbox 和 OneDrive 等云存储服务,可直接访问文件。 该工具解决了未安装 Microsoft Office 的设备上编辑 Office 文档时的重大隐私问题,消除了敏感数据被上传到第三方服务器的风险。通过利用 WebAssembly,它展示了一种在客户端完全运行复杂办公应用的实用方法,可能影响未来基于网络的生产力工具。其 AGPL 开源特性也鼓励社区贡献和透明度。 ZIZIYI Office 可通过 office.ziziyi.com 访问,由 WebAssembly 驱动,确保文件保留在用户设备上。它支持编辑 .docx、.xlsx 和 .pptx 格式,并为中国用户提供专门的加速入口。该项目托管在 GitHub 上,地址为 github.com/baotlake/office-website,使用在线版本无需安装。
背景
传统的在线办公套件(如 Zoho Office Suite)以 SaaS 模式运行,需要将文件上传到远程服务器进行处理,这引发了隐私担忧。WebAssembly 是一种二进制指令格式,允许高性能应用在 Web 浏览器中以接近原生的速度运行,使办公套件等复杂软件能够完全在客户端执行。AGPL(Affero 通用公共许可证)是一种强 copyleft 许可证,要求衍生作品即使在网络上使用也必须开源。
8月17日 07:30在 X 打开#open-source #office #privacy #web-tools #productivity
077.0
分享精选的40多条Claude Code技巧仓库
开发者 ykdojo 整理了一个 GitHub 仓库,收录了 40 多条 Claude Code 实用技巧,涵盖从基础操作到进阶玩法。其中最实用的是状态栏改造,可以在一行内显示模型、分支和 token 用量进度条,此外还包括语音派活、手机远程控制和多账号切换等功能。推文强调这些技巧对日常使用 Claude Code 的开发者来说可以立即应用。 Claude Code 是一个智能体编码环境,能够自主读取文件、运行命令和进行修改,但许多用户只使用了其表面功能。这个精选合集降低了采用高级工作流的门槛,有望提升开发者的生产力和效率。它也反映了围绕 AI 编码工具日益增长的社区驱动资源生态。 状态栏定制可以通过 Claude Code 中的 /statusline 命令实现,该命令接受自然语言指令并在 ~/.claude/ 目录下生成脚本文件。仓库地址为 github.com/ykdojo/claude-code-tips,并包含一个用于日常开发的插件。技巧涵盖语音控制、手机远程控制和多账号切换等。
背景
Claude Code 是 Anthropic 开发的智能体编码工具,不仅能聊天,还能自主执行命令和修改代码。它支持通过 /statusline 等命令进行定制,允许用户定义终端状态栏显示的信息。该工具因能处理复杂编码任务而受到开发者欢迎,并形成了一个分享技巧和插件的用户社区。
8月17日 04:00在 X 打开#Claude Code #developer tools #productivity #AI coding #tips
087.0
Monday.com 的 Sidekick AI 助手使用 LangSmith 沙箱处理复杂任务
Monday.com 构建了一款名为 Sidekick 的 AI 助手,它不仅能回答问题,还能处理复杂的迭代任务,例如分析 CSV 文件或即时生成地图。为了实现这一能力,他们为智能体提供了由 LangSmith 沙箱支持的隔离工作区。LangChain 分享了一篇详细的案例研究,介绍了其架构和经验教训。 该案例研究展示了一种实用的模式,用于构建能够在生产环境中安全执行代码并完成多步骤工作的强大 AI 智能体。随着 AI 助手从简单的聊天机器人演变为自主的数字员工,安全、隔离的执行环境变得越来越重要。这种方法可能会影响其他企业级 SaaS 平台设计其 AI 助手的方式。 LangSmith 沙箱提供临时的、隔离的微虚拟机环境,启动时间不到一秒,并支持有状态会话,使智能体能够安全地大规模运行不受信任的代码。Monday.com 的 Sidekick 利用这些沙箱为智能体提供隔离的工作区,以处理复杂的迭代任务。该案例研究强调,强大的智能体不仅需要工具,还需要安全的运行时环境。提供的摘要中未披露具体的性能指标或定价细节。
背景
LangChain 是一个流行的开源框架,用于构建基于大语言模型(LLM)的应用程序。LangSmith 是 LangChain 的商业平台,提供 LLM 应用的可观测性、评估和部署能力,其中包含沙箱——用于执行智能体生成代码的托管隔离环境。Monday.com 是一个工作操作系统,帮助团队管理项目和工作流程;Sidekick 是其内置的 AI 助手,旨在执行任务而不仅仅是回答问题。AI 助手越来越多地被期望代表用户采取行动,这需要安全地执行代码并访问工具。
8月17日 18:42在 X 打开#AI agents #LangChain #case study #LLM applications #software engineering
097.0
LangChain 与 AWS 推出 AgentCore 支付中间件,实现代理自主支付 API 费用
LangChain 与 AWS 合作推出了 AgentCore 支付中间件。该中间件使 AI 代理能够在访问付费 API 时自动处理 HTTP 402 Payment Required 响应。当工具遇到 402 状态码时,中间件会将会话预算与价格进行核对,签署支付并重试请求,使代理无需人工干预即可获取数据。 这一集成填补了代理工作流中的一个关键空白:自主支付 API 使用费用的能力。它为更无缝的“代理网络”铺平了道路,使 AI 代理能够独立与付费服务进行交易。通过将支付嵌入代理的推理循环并在 LangSmith 中记录,它还增强了自动化支出的透明度和问责制。 该中间件支持 x402 Payment Required 协议,这是一种基于 HTTP 402 的微支付新兴标准。它在签署支付前会将会话预算与价格进行核对,防止超支。所有支付事件都会与触发支付的推理过程一起记录在 LangSmith 中,提供审计追踪。该功能目前适用于部署在 Amazon Bedrock AgentCore 上的 LangGraph 代理。
背景
HTTP 402 Payment Required 是一个状态码,表示在访问资源之前需要付款。该状态码历史上很少使用,但在新兴的代理网络中,它正逐渐成为 API 变现的一种机制。LangChain 是一个用于构建大语言模型应用的流行框架,LangSmith 是其用于追踪和监控代理行为的可观测性平台。Amazon Bedrock AgentCore 是 AWS 的一项托管服务,用于部署和运营生产级 AI 代理。
8月17日 17:01在 X 打开#AI agents #LangChain #AWS #payments #middleware
107.0
AI模型是否被故意变笨?
Bilgin Ibryam 的一条推文链接到一篇博客文章,声称 AI 模型被故意降低了能力。该博客认为,最近的模型更新(例如 Anthropic 的 Claude Opus 4.6)显示出一种故意降低能力的模式。这引发了关于提供商是否出于安全或其他原因故意降低模型能力的争论。 如果属实,故意降低模型能力将破坏对 AI 提供商的信任,并迫使开发者不断重新评估模型性能。这也可能标志着从原始能力向安全性和专业化的转变,影响 AI 在高风险应用中的部署方式。这场争论凸显了性能与负责任 AI 之间的紧张关系。 该博客特别指出 Anthropic 的 Claude Opus 4.6 是感知退化的一个例子,尽管 Anthropic 否认故意破坏。一些观察者指出,提供商故意降低 Cyberbench 等基准测试的表现可能被视为一种“负责任的 AI 炫耀”。然而,其他来源认为,明显的退化可能源于记忆管理问题或提示方式的变化,而非故意行为。
背景
像 GPT-4 和 Claude 这样的 AI 语言模型是在海量数据集上训练的,并且会根据提示和上下文表现出不同的行为。模型退化是指随着时间的推移,性能出现可感知的下降,这可能是由更新、微调或推理参数的变化引起的。提供商经常更新模型以提高安全性、减少偏见或优化成本,这可能会无意中影响能力。关于故意退化的争论是 AI 开发中透明度和问责制更广泛讨论的一部分。
8月17日 22:14在 X 打开#AI #LLM #AI safety #model behavior
117.0
Protobuf 通过 Buf 获得语言服务器协议支持
Buf 宣布为 Protocol Buffers(Protobuf)提供官方的语言服务器协议(LSP)支持。这意味着开发者现在可以在支持 LSP 的编辑器和 IDE 中,为 .proto 文件获得自动补全、跳转到定义和诊断等功能。该消息通过 buf.build 上的一篇博客文章发布。 LSP 支持显著改善了 Protobuf 的开发体验,而 Protobuf 在微服务、gRPC 和数据序列化中被广泛使用。它通过将丰富的语言功能直接带入编辑器,降低了入门门槛并减少了上下文切换。这与通过 LSP 标准化语言工具的行业趋势一致。 LSP 支持由 Buf 提供,Buf 是一个面向 Protobuf 和 gRPC 的现代工具链。博客文章可能详细介绍了在各种编辑器中的安装和配置。推文摘要中未提供具体功能、性能基准和兼容性细节。用户应参考 Buf 官方文档了解确切能力。
背景
Protocol Buffers(Protobuf)是一种由 Google 开发的语言中立、平台中立的结构化数据序列化机制。语言服务器协议(LSP)是一种开放的、基于 JSON-RPC 的协议,允许编辑器和 IDE 与语言服务器通信,以提供自动补全和跳转到定义等功能。Buf 是一个流行的工具链,简化了 Protobuf 开发,包括代码检查、格式化和代码生成。在此公告之前,Protobuf 缺乏一流的 LSP 实现,开发者不得不依赖编辑器特定的插件或有限的工具。
8月17日 10:31在 X 打开#protobuf #LSP #developer-tools #IDE
127.0
从真实用户轨迹构建LLM评估的实用指南
@realmadhuguru 发布了一条推文,提出了提高LLM评估质量的四步方法:研究真实用户轨迹、捕捉失败模式、自动化执行评估,并让评估与不断变化的线上流量保持一致。作者表示这可能成为一个每日系列,并询问读者是否感兴趣。 这条建议直击AI工程师的常见痛点:不反映真实使用情况的评估很快就会失效。通过将评估锚定在生产轨迹和失败模式上,团队可以构建更可靠的质量关卡,并在问题影响用户之前发现回归。 该方法强调研究典型用户的提示序列,而不仅仅是单个输出。它还特别指出混乱的工具调用响应和缺失的上下文是需要捕捉的失败模式。作者建议让评估易于重复和自动运行,然后确保它们随着用户模式的变化继续反映线上流量。
背景
LLM评估是系统性地衡量模型输出质量的方法,通常使用准确性、相关性或安全性等指标。追踪(Tracing)捕获应用程序中提示、响应和工具调用的完整序列,为构建评估提供原始素材。Arize Phoenix、Comet Opik和DeepEval等工具可帮助自动化追踪和评估。影子流量和金丝雀部署是在不影响全部用户的情况下,用线上流量测试评估的技术。
8月17日 22:34在 X 打开#evals #LLM #testing #workflow #AI