8月19日2026 · 星期三

从 35 条抓取中筛选 12 条 · twitter × 7 账号 · 00:46 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. Claude 自主设计出 15 个靶点中 14 个的新型蛋白结合剂9.0
  2. Qwen3.8-27B:首个达到前沿AI性能的本地模型9.0
  3. Jason Wei:小模型加工具无法匹敌大模型的智能8.0
  4. Z.ai 发布 GLM-5.3 API,面向编程、网络安全和智能体任务8.0
  5. OpenAI 暂停前沿模型强化学习训练以强化安全措施8.0
  6. 知名开发者力挺云端AI代理,称本地开发或成过去式8.0
  7. AI 转向后训练与编程产品数据飞轮7.0
  8. 豆包Agent更新模仿Codex,支持GUI电脑操作与手机远程控制7.0
  9. Consent-O-Matic:开源浏览器扩展自动处理 Cookie 同意弹窗7.0
  10. Needle 2:面向微型边缘设备的14MB、4500万参数智能体模型7.0
  11. JobSync:开源AI求职申请追踪工具,支持自托管7.0
  12. DSH Desktop 将 DeepSeek Harness 封装为易用桌面应用7.0
019.0

Claude 自主设计出 15 个靶点中 14 个的新型蛋白结合剂

Anthropic 宣布,Claude 在人类专家撰写的蛋白质设计提示下,自主针对 15 个靶点中的 14 个设计出了新型蛋白结合剂。这些设计的蛋白质由 Adaptyv Bio 和 Twist Bioscience 独立构建并测试,验证了结果。这表明在自动化从头蛋白结合剂设计方面迈出了重要一步。 这一突破可能大幅加速药物发现,因为设计紧密结合的分子传统上是每个靶点需要数周或数月专家工作的瓶颈。如果 Claude 能可靠地设计功能性结合剂,它可能降低药物研究的成本和时间,使 AI 成为生物技术的核心工具。两家公司的独立验证增加了这一说法的可信度。 成功率为 15 个靶点中的 14 个,但公告中未披露具体的结合亲和力、靶点身份和实验细节。设计过程依赖于人类专家的提示,因此尚未实现完全自主。验证由 Adaptyv Bio 和 Twist Bioscience 完成,但推文中未提供定量基准。公告链接到 Anthropic 的研究页面,可能包含更多细节。

@AnthropicAI原推文1 个视频Many drugs work by binding to a specific target in the body and blocking or changing what it does. An important first step in the drug development process is designing a molecule that can bind tightly to its target. Traditionally, that's meant weeks or months of expert work per target, sifting through a large number of candidates to identify the few that work. We wanted to test if Claude could successfully design novel protein binders from scratch (also called de novo design). With a protein design prompt written by a human expert, Claude autonomously designed protein binders against 14 out of 15 targets. We then worked with Adaptyv Bio and Twist Bioscience, who independently built and tested the proteins Claude designed.原推文媒体预览展开原推文收起原推文

@AnthropicAI

Many drugs work by binding to a specific target in the body and blocking or changing what it does. An important first step in the drug development process is designing a molecule that can bind tightly to its target. Traditionally, that's meant weeks or months of expert work per target, sifting through a large number of candidates to identify the few that work. We wanted to test if Claude could successfully design novel protein binders from scratch (also called de novo design). With a protein design prompt written by a human expert, Claude autonomously designed protein binders against 14 out of 15 targets. We then worked with Adaptyv Bio and Twist Bioscience, who independently built and tested the proteins Claude designed.

背景
蛋白结合剂是附着于特定靶点的分子,通常用于阻断或改变其功能,在药物开发中至关重要。从头设计意味着不基于现有天然蛋白质,从零开始创建这些结合剂。传统方法需要大量的实验筛选和专家迭代,但最近的 AI 模型如 RFdiffusion 和 BindCraft 在自动化这一过程方面显示出前景。Claude 是 Anthropic 开发的大型语言模型,这一公告表明它可以应用于文本生成之外的蛋白质设计任务。

8月18日 22:30在 X 打开#AI #drug discovery #protein design #Claude #biotech

029.0

Qwen3.8-27B:首个达到前沿AI性能的本地模型

阿里巴巴通义千问发布了Qwen3.8-27B,这是一个270亿参数的稠密模型,在Artificial Analysis智能指数上获得52分,与DeepSeek V4-Pro和GPT-5.6 Luna等前沿模型性能相当。这是本地模型首次达到前沿水平的能力,Cline和社区演示也强调了这一点,显示其在创意任务上超越了Gemini-3.7-flash。 这一里程碑改变了AI部署格局,使前沿水平的智能可以在消费级硬件上运行,减少了对云API的依赖并降低了成本。它可能为开发者、研究人员和注重隐私的用户普及先进AI能力,并加速边缘计算和设备端AI的创新。 Qwen3.8-27B是一个拥有270亿参数的稠密模型,采用混合注意力架构,64层中只有16层运行完整注意力。它可以在单张RTX 3090 GPU上以Q5量化运行,甚至可以通过自定义WebGPU内核在浏览器中运行。该模型通过Qwen3_5ForConditionalGeneration加载以实现软件兼容,其长上下文服务可能需要超出加载权重的大量内存。

@Alibaba_Qwen引用推文1 张图片A local 27B model scoring frontier performance! Huge thanks to @cline for the shoutout.🥳 This is just the beginning — Qwen3.8-27B will keep finding its way into more fields.🌱原推文媒体预览展开原推文收起原推文

@Alibaba_Qwen

A local 27B model scoring frontier performance! Huge thanks to @cline for the shoutout.🥳 This is just the beginning — Qwen3.8-27B will keep finding its way into more fields.🌱

@cline

Artificial Analysis Intelligence Index puts Qwen3.8-27B at DeepSeek V4-Pro and GPT 5.6 Luna performance. This is the first time a local model has scored frontier model capability. We weren’t expecting this pace of local progress anywhere near this soon.

背景
Artificial Analysis智能指数是一个综合基准,衡量推理、编码、知识、指令遵循、科学推理和多步骤任务能力。本地模型在用户硬件上运行,具有隐私和成本优势,但通常落后于前沿云模型。Qwen是阿里巴巴的开源模型系列,以具有竞争力的性能著称。Qwen3.8-27B是一个稠密变体,意味着推理时所有参数都处于激活状态,不同于混合专家模型。
社区讨论
社区反应非常积极,用户对该模型的创意能力表示惊叹,例如生成视觉惊艳的水面模拟,击败了Gemini-3.7-flash。一些人指出本地模型进步的速度令人惊讶,另一些人则强调在单张3090 GPU上运行的实用性。人们对开源权重模型与专有前沿系统竞争的前景感到兴奋。

8月18日 04:15在 X 打开#AI #local model #Qwen #frontier performance #breakthrough

038.0

Jason Wei:小模型加工具无法匹敌大模型的智能

思维链提示技术的核心作者之一 Jason Wei 发布新推文,反驳“小模型+工具”路线。他认为仅靠 10 亿参数的认知核心加外部工具(如联网搜索、执行代码)无法达到顶级智能。他以自己学习羽毛球的亲身经历作类比,说明内化知识与临时检索之间的差距。 这场辩论直接影响 AI 发展路线:是继续扩大模型规模,还是走工具增强的小模型路线。Wei 的观点强化了“苦涩的教训”——扩大算力和数据带来的能力提升胜过精巧的工程设计。这会影响 AI 实验室的资源分配,以及需要高质量推理的应用产品设计。 Wei 给出三个具体理由:速度(直接回答比调用工具快)、理解深度(大模型基于海量数据给出综合判断,小模型只能搬运搜索结果前几条)、可靠性(反复查资料和推导出错概率更高,长任务中错误会累积)。他还指出 10 亿参数模型能内化的知识有上限,即使 1 万亿参数也可能不够。

@dotey引用推文一直有一种观点,就是小模型加 Harness,就能达到大模型的智能效果: > 只需要一个 10 亿参数的小模型作为“认知核心”,其余能力靠联网搜索、执行代码等工具补齐就够了。 Jason Wei (思维链提示技术的核心作者之一)的新推文,反驳了“小模型+工具”路线,认为光靠工具,撑不起顶级智能,把知识“内化在大脑”和“现查现用”是两回事。 小模型+工具就能行的观点之所以流行,因为理论上确实说得通:模型不知道的冷门知识,可以上网查;不会算的题,可以调用代码。小模型加工具,似乎没有做不到的事。而小模型意味着更低的算力成本,对整个行业都很有吸引力。 他用自己学羽毛球打了个比方。教练教的每个动作他都能做出来,但要在实战中流畅串联,跟练了上万次形成肌肉记忆的人完全不是一个级别。语言模型也一样,内化了知识的大模型和靠工具临时检索的小模型,体验差距很明显。 具体来说有三点。第一是速度,直接给出答案远比调用工具搜一圈再回答快得多。第二是理解的深度,比如你问一个音乐节的口碑如何,大模型能基于海量数据给出综合判断,而小模型只能搬运搜索结果里排在前面的几条评论。第三是可靠性,每次都要重新查资料、重新推导,出错的概率更高,在复杂的长任务中错误还会层层累积。 回顾“苦涩的教训”(Bitter Lesson)里面的观点:历史反复证明,靠扩大规模获得的能力提升,总是胜过精巧的工程设计。工具让小模型能做更多事,但追求最高质量的用户,始终会需要更大的模型。展开原推文收起原推文

@dotey

一直有一种观点,就是小模型加 Harness,就能达到大模型的智能效果: > 只需要一个 10 亿参数的小模型作为“认知核心”,其余能力靠联网搜索、执行代码等工具补齐就够了。 Jason Wei (思维链提示技术的核心作者之一)的新推文,反驳了“小模型+工具”路线,认为光靠工具,撑不起顶级智能,把知识“内化在大脑”和“现查现用”是两回事。 小模型+工具就能行的观点之所以流行,因为理论上确实说得通:模型不知道的冷门知识,可以上网查;不会算的题,可以调用代码。小模型加工具,似乎没有做不到的事。而小模型意味着更低的算力成本,对整个行业都很有吸引力。 他用自己学羽毛球打了个比方。教练教的每个动作他都能做出来,但要在实战中流畅串联,跟练了上万次形成肌肉记忆的人完全不是一个级别。语言模型也一样,内化了知识的大模型和靠工具临时检索的小模型,体验差距很明显。 具体来说有三点。第一是速度,直接给出答案远比调用工具搜一圈再回答快得多。第二是理解的深度,比如你问一个音乐节的口碑如何,大模型能基于海量数据给出综合判断,而小模型只能搬运搜索结果里排在前面的几条评论。第三是可靠性,每次都要重新查资料、重新推导,出错的概率更高,在复杂的长任务中错误还会层层累积。 回顾“苦涩的教训”(Bitter Lesson)里面的观点:历史反复证明,靠扩大规模获得的能力提升,总是胜过精巧的工程设计。工具让小模型能做更多事,但追求最高质量的用户,始终会需要更大的模型。

@_jasonwei

When language models first started using tools well, I was sympathetic to the narrative that instead of scaling up language models, all we needed was a strong enough "cognitive core", say 1B parameters, and anything else could be done with tool use, like browsing the internet or executing code. I think a lot of people were sympathetic to this argument, and indeed it is pretty hard to come up with a meaningful task that cannot be in principle achieved by a 1B model with adequate access to tools. For example, any esoteric fact that a large language model would know can be, in principle, retrieved from the internet and reasoned over by a 1B language model. However I now think this is totally wrong for one simple reason: doing tasks quickly and naturally without tool use matters a lot. The way that I internalized this reason was actually in my personal journey learning badminton this year. In badminton I am very much like a "1B cognitive core". While I can physically do every movement in a badminton shot that my coach teaches me, it requires a lot of work to mentally remember every cue and put it together. In practice I can do a shot almost perfectly, but I struggle to do it across a point and I definitely can't do it consistently in a game. This is obviously different from someone who has practiced a shot ten-thousand times and effortlessly executes it as a natural instinct. In the same way, language models knowing a fact internally, without tool calls, is meaningful. The first reason is that we obviously care about speed; you'd much rather get an answer immediately than have the model think a long time to be sure of its answer or browse the web. A second reason is that there are some things that are simply best learned via backpropagation over lots of data. If you ask about how people generally think of the Shambhala music festival, you'd rather a large language model give you an aggregate opinion based on all the data on the internet, than get a regurgitation of the first three reviews that show up in a web search. A third reason is that having to do a lot of work to find an answer is not as reliable as already knowing the answer. While this does not have to be true in theory, it is probably true in practice, at least for now. If you have to re-look up facts or redo a mathematical derivation all the time there is a higher chance of mistakes, which can compound in a long-horizon task. Once you buy that it is valuable to do things parametrically without tool use, then you must buy the argument that a 1B cognitive core is not sufficient. There is an information limit to how much knowledge can be internalized by a 1B model, and we will surely want AI to know more than that. Even 1T probably won't be enough. We will want the AI to know as much about our world as possible, we will want it to be updated with new information, and our expectations of what AI can do for us will continue to grow. In summary, tool use enables small models to do a lot more, but those who demand the highest quality intelligence will always want larger models. Bitter lesson strikes again.

背景
思维链(CoT)提示是一种鼓励大语言模型生成中间推理步骤的技术,能显著提升复杂任务的表现。Jason Wei 是 CoT 的关键研究者之一。“苦涩的教训”是 Rich Sutton 的一篇文章,认为利用算力的通用方法始终胜过依赖人类设计知识的方法。扩大模型规模与用工具增强小模型之间的辩论,一直是 AI 战略讨论的核心。

8月18日 14:12在 X 打开#AI #language models #scaling #tools #Jason Wei

048.0

Z.ai 发布 GLM-5.3 API,面向编程、网络安全和智能体任务

Z.ai 发布了 GLM-5.3 API,这是一款针对编程、防御性网络安全和长周期智能体任务进行优化的大型语言模型。其价格与上一代 GLM-5.2 相同,可通过官方 API 和合作伙伴模型网关使用。 此次发布让开发者在不增加成本的情况下,获得了一款在复杂软件工程和自主智能体工作流方面能力更强的模型。对防御性网络安全的关注,回应了 AI 辅助安全运营日益增长的需求;而对长周期智能体的支持,则让多步骤自动化更加可靠。 GLM-5.3 是一款大规模推理模型,拥有 100 万 token 的上下文窗口,在编程能力以及性能与 token 效率的平衡方面优于 GLM-5.2。它支持文本输入和输出,可通过 OpenRouter 及其他合作伙伴网关使用。部分第三方文档指出,Z.ai 自身的通用 API 访问仍标记为“即将推出”,因此不同平台的可用性可能有所不同。

@Zai_org原推文1 张图片GLM-5.3 API is now live. - Built for coding, defensive cybersecurity, and long-horizon agentic tasks - Priced the same as GLM-5.2 - Available via the official API and partner model gateways Get started: https://docs.z.ai/guides/llm/glm-5.3原推文媒体预览展开原推文收起原推文

@Zai_org

GLM-5.3 API is now live. - Built for coding, defensive cybersecurity, and long-horizon agentic tasks - Priced the same as GLM-5.2 - Available via the official API and partner model gateways Get started: https://docs.z.ai/guides/llm/glm-5.3

背景
GLM(通用语言模型)是 Z.ai 开发的一系列大型语言模型,该公司以提供开源和 API 可访问的 AI 模型而闻名。长周期智能体任务指的是 AI 智能体在较长时间内自主执行多个相互依赖步骤的复杂工作流,例如多阶段研究或软件工程。防御性网络安全是指利用 AI 检测、预防和响应威胁,从被动安全转向主动安全。100 万 token 的上下文窗口使模型能够在单次请求中处理非常长的文档或代码库。

8月18日 20:46在 X 打开#AI #LLM #API #coding #cybersecurity

058.0

OpenAI 暂停前沿模型强化学习训练以强化安全措施

OpenAI 宣布暂时暂停其最新待部署模型的强化学习(RL)训练,为期两周。在此期间,公司强化并对研究环境进行了红队测试,同时扩大了监控覆盖范围。最大规模的前沿 RL 训练计划仍处于暂停状态,等待小规模训练和评估验证新的安全措施。 此举表明 OpenAI 将内部开发风险与外部部署风险同等重视,尤其是在模型能力不断增强的背景下。这可能为其他 AI 实验室树立先例,促使它们采取类似的安全暂停措施,并影响前沿模型开发的行业规范。此次暂停也凸显了在扩大训练规模之前获取对齐证据的重要性。 暂停持续两周,专门针对待部署模型的 RL 训练。OpenAI 最大规模的前沿 RL 训练计划仍处于暂停状态,而小规模训练和评估正被用于验证安全措施并收集对齐证据。公告引用了关于控制模型开发节奏以应对网络能力风险的博客文章,表明对网络安全领域滥用的担忧。

@OpenAI原推文As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment. https://openai.com/index/pacing-model-development-cyber-capabilities/展开原推文收起原推文

@OpenAI

As models become more capable, the risks associated with developing and testing them internally also grow. We temporarily paused reinforcement learning (RL) training on our latest models intended for deployment for two weeks while we hardened and red-teamed our research environments and expanded monitoring coverage. Our largest planned frontier RL run remains on hold while smaller-scale training and evaluations validate these safeguards and establish more evidence of alignment. https://openai.com/index/pacing-model-development-cyber-capabilities/

Pacing model development in an era of cyber-critical capabilitiesopenai.com · 直连原文
背景
强化学习(RL)是一种机器学习范式,智能体在环境中学习采取行动以最大化奖励信号。AI 红队测试是一种对抗性测试,旨在部署前暴露漏洞、偏见和安全缺口。前沿模型是能力极强、通用性高的 AI 系统,处于当前能力的最前沿。OpenAI 的暂停反映了行业日益增长的趋势,即在开发阶段而非仅在发布前实施安全措施。

8月18日 18:13在 X 打开#AI safety #OpenAI #reinforcement learning #model deployment #frontier models

068.0

知名开发者力挺云端AI代理,称本地开发或成过去式

知名开发者 Matt Pocock 公开赞同 Jared Palmer 的观点,后者表示自己已经“极度痴迷云端代理”,自加入 Devin 的开发商 Cognition 以来,甚至没有配置过本地开发环境。Palmer 声称,通过 Slack 和网页应用使用 Devin 进行开发,在各个方面都优于本地开发,即使是前端工作也是如此。Pocock 补充说,未来我们会把“一个开发者、多个终端”的时代视为一段尴尬的过渡期。 来自有影响力的开发者的背书,预示着软件开发可能发生范式转变:云端AI代理或将取代传统的本地开发环境。如果这一趋势持续下去,可能会颠覆开发者工具、IDE和工作流程,并加速 Devin 等自主编码代理的普及。这种转变还可能改变工程团队的协作方式和资源分配。 Jared Palmer 是一位知名开发者,加入了自主AI软件工程师 Devin 背后的公司 Cognition。他特别提到在 Slack 中与同事一起使用 Devin,以及通过网页应用使用,并表示自己无需配置本地开发环境。这条推文没有提供具体的基准测试或量化对比,其说法基于个人经验而非对照研究。Devin 的定位是帮助工程团队将完整任务交给自主代理处理。

@mattpocockuk引用推文It me We'll look back on "one dev, many terminals" as an awkward interregnum展开原推文收起原推文

@mattpocockuk

It me We'll look back on "one dev, many terminals" as an awkward interregnum

@jaredpalmer

I've become extremely cloud agent-pilled. I still haven’t setup my laptop for local development since joining Cognition and it’s still unclear to me when I will have to. Working with Devin in Slack (with coworkers) and the webapp with the latest crop of models is better in every possible way so far, even for frontend work

背景
Devin 是由 Cognition AI 开发的自主AI软件工程师,旨在端到端地处理完整的编码任务,包括规划、编写代码和调试。云端AI代理运行在远程服务器上,通过网页界面或 Slack 等聊天平台访问,无需配置本地环境。传统的本地开发需要在开发者自己的机器上设置 IDE、终端和依赖项。“一个开发者、多个终端”指的是单个开发者管理多个终端窗口以处理不同任务的常见做法,而云端代理旨在将其整合。

8月18日 05:56在 X 打开#AI agents #cloud development #Devin #developer tools #future of work

077.0

AI 转向后训练与编程产品数据飞轮

该推文讨论了 AI 模型进步正从参数规模扩展转向基于真实任务数据的后训练。它强调像 ZCode 这样的编程产品可以作为数据入口,形成“产品使用→数据→模型升级→更多使用”的飞轮。讨论引用了高盛关于 GLM-5.3 的报告,指出其参数规模基本不变(约 744B),但通过更长任务环境、强化学习和工具协同提升了代码、长任务执行和安全能力。 这一转变意味着竞争优势将越来越多地来自专有的真实任务数据,而非单纯的模型规模。对于 AI 公司而言,编程产品成为既能变现又能生成训练数据的战略资产。投资者应关注三个转化率——模型能力到用户使用量、用户使用量到付费收入、真实任务数据到下一代模型能力——而非仅仅看基准分数。 GLM-5.3 与 GLM-5.2 使用相同的基础模型,所有提升均来自后训练,参数规模为 7430 亿。ZCode 是 GLM-5.3 的官方集成环境,将模型与 AI 编程代理及现有工具结合。推文强调技术突破只能解释产品为何更强,估值最终取决于收入增速、付费率和利润率。

@dotey引用推文1 张图片Deepseek Harness 如果是 SDK 为主也能达到数据入口的效果吗? > 像 ZCode 这样的 Coding 产品,不只是变现工具,也可能成为数据入口:用户完成真实的软件工程任务,产生长周期执行轨迹,再反哺下一轮 Post-training,形成“产品使用 → 数据 → 模型升级 → 更多使用”的飞轮。原推文媒体预览展开原推文收起原推文

@dotey

Deepseek Harness 如果是 SDK 为主也能达到数据入口的效果吗? > 像 ZCode 这样的 Coding 产品,不只是变现工具,也可能成为数据入口:用户完成真实的软件工程任务,产生长周期执行轨迹,再反哺下一轮 Post-training,形成“产品使用 → 数据 → 模型升级 → 更多使用”的飞轮。

@Anitahityou

高盛的这篇智谱 GLM-5.3 的报告值得一看。 大模型竞争逻辑正在发生变化👉Scaling 正从一味堆参数,转向 Post-training。 GLM-5.3 参数规模基本没变,仍约 744B,但通过更长任务环境、更长训练时间、强化学习和工具协同,代码、长任务执行和安全能力继续提升。 模型进步开始越来越依赖“真实任务里的训练”,而不是单纯做更大的模型。 这背后还有一层更重要的商业逻辑。像 ZCode 这样的 Coding 产品,不只是变现工具,也可能成为数据入口:用户完成真实的软件工程任务,产生长周期执行轨迹,再反哺下一轮 Post-training,形成“产品使用 → 数据 → 模型升级 → 更多使用”的飞轮。 所以资本市场接下来真正要看的,已经不是 GLM-5.3 比 DeepSeek、Claude 高几个 Benchmark 点,而是三个转化率: 1️⃣ 模型能力 → 用户使用量 2️⃣ 用户使用量 → 付费收入 3️⃣ 真实任务数据 → 下一代模型能力 这也是为什么模型升级和股价逻辑要分开看。技术突破只能解释为什么产品更强,估值最终还是要靠收入增速、付费率和利润率兑现。 模型能力是起点,数据飞轮是护城河,商业化效率才是估值终点。

背景
后训练是指在初始预训练之后进行的额外训练,通常使用强化学习或精选数据来提升特定能力。数据飞轮是一种自我强化的循环:产品使用产生数据,数据改进模型,从而吸引更多用户。GLM-5.3 是 Z.ai(原智谱 AI)推出的大语言模型,定位为顶级开源权重编程模型。ZCode 是围绕 GLM 模型构建的 AI 驱动开发环境,与 Cursor、GitHub Copilot 等工具竞争。

8月18日 14:44在 X 打开#AI #post-training #data flywheel #GLM-5.3 #business strategy

087.0

豆包Agent更新模仿Codex,支持GUI电脑操作与手机远程控制

豆包推出重大更新,在Windows桌面应用中加入了类似Codex的GUI电脑操作和手机远程控制功能。新的“豆包虚拟桌面”功能允许AI独立操作电脑,而不会占用用户的鼠标和键盘。用户现在可以通过手机上的豆包应用远程控制电脑,完成查找文档并发送到飞书等任务。 此次更新使豆包在中国市场成为OpenAI Codex的有力竞争者,因为ChatGPT和Claude在中国无法使用。通过提供不干扰用户当前工作的虚拟桌面,豆包解决了Claude Code的Computer Use的一个关键痛点。手机远程控制功能将Agent能力扩展到用户不在电脑旁的场景,充分利用桌面环境的全部资源。 虚拟桌面基于GUI能力,无需MCP、API、插件或CLI。它在相对独立的环境中运行,用户可以实时查看操作步骤,并随时暂停或接管任务。手机远程控制需要在手机和电脑上登录相同账号,且电脑必须允许手机连接。该功能目前仅在Windows上可用;Mac仅支持内置浏览器内的GUI操作。

@dotey原推文4 张图片豆包越来越像 Codex 了,这是我最近用下来最直观的感受。Codex 一直是我心里 Agent App 体验的标杆,而豆包这波更新,从 GUI 电脑操作到手机远程操控,很多设计思路都能看到 Codex 的影子,有些地方甚至做了本土化的超越。 最近我老婆回国,在国内用不了 ChatGPT 和 Claude 这些,日常就用豆包帮她查资料、做攻略。这两天她需要在自己电脑里找个文档,人在国内,电脑在美国——直接用手机上的豆包指挥美国这边的电脑,帮她把文档找出来发到飞书,手机上就能访问了,非常方便。 注意使用的时候要在手机和电脑上登录相同的账号,并且电脑上要允许手机连接才行。然后从手机打开“工作任务”,就可以在底部看到你连接的电脑端。 (参考图3图4) 手机指挥 Agent 现在是我日常用得很多的功能。在外面的时候可以随时从手机看 Agent 任务的执行进度,或者临时想到什么事情,通过手机就能指挥家里/公司电脑上的 Agent 去执行,回家直接看结果,通勤路上也不耽误。 之所以要通过手机指挥电脑,是因为电脑上的资源通常是最全的:硬盘上有所有文档、代码库,有各种配置好的技能,而电脑又不可能一直随身带着。想想看,快下班的时候还有个任务没跑完,又不想干等着,那就先让 Agent 跑着,用手机连上电脑随时看进度,有问题还能中途插话调整。动口不动手,重复活儿全甩给它。 豆包在 Windows 版本上的 GUI 电脑操作功能体验下来相当的好用,它巧妙的通过豆包虚拟桌面让人和 AI 同时操作电脑,互不干扰,这点优势还蛮明显的,有点我第一次用 Codex 在 Mac 上的 Computer Use 感觉一样,就是它帮你操作电脑 App,但是完全不影响你当前正在执行的任务。不像 Claude Code 一旦使用 Computer Use,你就得等它操作完才能继续干活。 (参考图1图2) Computer Use 让 Agent 直接帮你操作图形界面的软件:点按钮、填表格、下载文件,理论上即使没有提供 CLI 的软件都能控制。日常能用的场景很多: - 办公类:新建和排版 Word/Excel/PPT,处理函数、生成图表,或者让它开着浏览器做调研然后直接产出 PPT - 桌面类:批量归类整理文件、改系统设置、管理启动项这类琐碎活儿 - 长尾类:PS 批量改图导出、证件照排版打印,甚至通过微信桌面版帮你发消息 - 发散玩法:游戏帧率优化设置、自动化信息收集整理…… 基本上你觉得「这活儿也能甩给 AI?」的重复劳动,都值得试试 我自己使用 Agent 有个技巧,就是尽可能让 Agent 能自己检查自己、拿到反馈。比如写程序,要让它自己写测试,或者用 Computer Use 去验证 App 的运行操作,自己去模拟用户操作;即使是让 AI 生成 PPT,也会让它自己截图验证下看看效果。这样可以减少人工干预,最大化利用好 Agent 的能力。 入口在豆包 PC 端的「工作任务」模式里,Windows 用户记得升级到最新版;Mac 目前还只支持内置浏览器的 GUI 操作。原推文媒体预览+3展开原推文收起原推文

@dotey

豆包越来越像 Codex 了,这是我最近用下来最直观的感受。Codex 一直是我心里 Agent App 体验的标杆,而豆包这波更新,从 GUI 电脑操作到手机远程操控,很多设计思路都能看到 Codex 的影子,有些地方甚至做了本土化的超越。 最近我老婆回国,在国内用不了 ChatGPT 和 Claude 这些,日常就用豆包帮她查资料、做攻略。这两天她需要在自己电脑里找个文档,人在国内,电脑在美国——直接用手机上的豆包指挥美国这边的电脑,帮她把文档找出来发到飞书,手机上就能访问了,非常方便。 注意使用的时候要在手机和电脑上登录相同的账号,并且电脑上要允许手机连接才行。然后从手机打开“工作任务”,就可以在底部看到你连接的电脑端。 (参考图3图4) 手机指挥 Agent 现在是我日常用得很多的功能。在外面的时候可以随时从手机看 Agent 任务的执行进度,或者临时想到什么事情,通过手机就能指挥家里/公司电脑上的 Agent 去执行,回家直接看结果,通勤路上也不耽误。 之所以要通过手机指挥电脑,是因为电脑上的资源通常是最全的:硬盘上有所有文档、代码库,有各种配置好的技能,而电脑又不可能一直随身带着。想想看,快下班的时候还有个任务没跑完,又不想干等着,那就先让 Agent 跑着,用手机连上电脑随时看进度,有问题还能中途插话调整。动口不动手,重复活儿全甩给它。 豆包在 Windows 版本上的 GUI 电脑操作功能体验下来相当的好用,它巧妙的通过豆包虚拟桌面让人和 AI 同时操作电脑,互不干扰,这点优势还蛮明显的,有点我第一次用 Codex 在 Mac 上的 Computer Use 感觉一样,就是它帮你操作电脑 App,但是完全不影响你当前正在执行的任务。不像 Claude Code 一旦使用 Computer Use,你就得等它操作完才能继续干活。 (参考图1图2) Computer Use 让 Agent 直接帮你操作图形界面的软件:点按钮、填表格、下载文件,理论上即使没有提供 CLI 的软件都能控制。日常能用的场景很多: - 办公类:新建和排版 Word/Excel/PPT,处理函数、生成图表,或者让它开着浏览器做调研然后直接产出 PPT - 桌面类:批量归类整理文件、改系统设置、管理启动项这类琐碎活儿 - 长尾类:PS 批量改图导出、证件照排版打印,甚至通过微信桌面版帮你发消息 - 发散玩法:游戏帧率优化设置、自动化信息收集整理…… 基本上你觉得「这活儿也能甩给 AI?」的重复劳动,都值得试试 我自己使用 Agent 有个技巧,就是尽可能让 Agent 能自己检查自己、拿到反馈。比如写程序,要让它自己写测试,或者用 Computer Use 去验证 App 的运行操作,自己去模拟用户操作;即使是让 AI 生成 PPT,也会让它自己截图验证下看看效果。这样可以减少人工干预,最大化利用好 Agent 的能力。 入口在豆包 PC 端的「工作任务」模式里,Windows 用户记得升级到最新版;Mac 目前还只支持内置浏览器的 GUI 操作。

背景
豆包是字节跳动的AI助手,类似于ChatGPT。Codex是OpenAI的智能编码工具,最近增加了电脑操作功能,使其能够操作桌面应用程序。Claude Code是Anthropic基于终端的编码助手,具有电脑操作预览功能。GUI电脑操作使AI代理能够通过图形界面与软件交互,如点击按钮和填写表单,而无需API或命令行工具。

8月18日 05:48在 X 打开#AI Agent #Doubao #Computer Use #Remote Control #Product Review

097.0

Consent-O-Matic:开源浏览器扩展自动处理 Cookie 同意弹窗

Consent-O-Matic 是一个开源浏览器扩展,可根据用户偏好自动填写 Cookie 同意弹窗。它支持 200 多种常见的同意管理组件,并由开源社区积极维护。该扩展可用于 Chrome、Firefox、Edge,甚至 iOS 上的 Safari。 Cookie 同意弹窗普遍令人烦恼,且常使用暗黑模式诱导用户接受追踪。Consent-O-Matic 自动处理这些弹窗,为用户节省时间、减少烦恼,同时增强隐私保护。Mozilla 和荷兰数据保护机构的推荐增加了其可信度。 该扩展由奥胡斯大学高级可视化与交互中心(CAVI)开发。它能识别 CMP(同意管理提供商)弹窗,并根据用户偏好自动填写,即使遇到暗黑模式也能处理。处理完成后,图标旁会显示一个小对勾,用户可点击图标为特定网站单独关闭该功能。规则由开源社区持续更新。

@GitHub_Daily原推文1 张图片首次打开的网页先弹 cookie 授权框,选项藏了七八层,改天清了缓存又全部再来一遍。 偶然发现 Consent-O-Matic 这个开源的浏览器插件,有了它,之后弹窗自动关闭。 一共兼容 200 多种主流弹窗组件,更重要的是规则一直有开源社区更新维护。 GitHub:http://github.com/cavi-au/Consent-O-Matic 兼容 Chrome、Firefox、Edge 等浏览器,就连手机版的 Safari 也能用。 处理完会在图标旁打个小对勾,哪个网站不想让它管,点一下图标单独关掉就行。 曾经 Mozilla 官方博客和荷兰数据保护机构都推荐过它,感觉挺靠谱的。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

首次打开的网页先弹 cookie 授权框,选项藏了七八层,改天清了缓存又全部再来一遍。 偶然发现 Consent-O-Matic 这个开源的浏览器插件,有了它,之后弹窗自动关闭。 一共兼容 200 多种主流弹窗组件,更重要的是规则一直有开源社区更新维护。 GitHub:http://github.com/cavi-au/Consent-O-Matic 兼容 Chrome、Firefox、Edge 等浏览器,就连手机版的 Safari 也能用。 处理完会在图标旁打个小对勾,哪个网站不想让它管,点一下图标单独关掉就行。 曾经 Mozilla 官方博客和荷兰数据保护机构都推荐过它,感觉挺靠谱的。

背景
根据 GDPR 和 ePrivacy 指令等法规,网站在存储追踪 Cookie 前必须获得用户同意,因此出现了 Cookie 同意弹窗。同意管理平台(CMP)提供这些弹窗,但许多使用暗黑模式诱导用户点击“全部同意”。像 Consent-O-Matic 这样的浏览器扩展充当中间人,根据用户偏好自动选择隐私友好的选项。该扩展是开源的,代码公开,任何人都可以审计或贡献。

8月19日 00:00在 X 打开#open-source #privacy #browser-extension #cookie-consent #tools

107.0

Needle 2:面向微型边缘设备的14MB、4500万参数智能体模型

Cactus Compute 发布了 Needle 2,这是一个开放的 4500 万参数模型,用于工具调用、设备使用和结构化提取。整个模型是一个 14MB 的二进制文件,完整会话仅需约 28MB 内存即可运行。它基于 Cactus 的 Simple Attention Network 构建,并压缩至 CQ2-bit 精度。 该模型使可穿戴设备、智能家居设备和机器人能够实现端侧 AI,在这些场景中,大型模型无法部署,而云端 API 又会带来隐私和延迟问题。其置信度评分机制允许对高置信度任务进行本地执行,对不确定任务回退到云端,从而平衡自主性与可靠性。这有望加速嵌入式系统中智能体 AI 的采用。 Needle 2 是开源的,可在 GitHub 上获取,并支持通过 Python 安装立即使用。它通过提供函数描述来支持函数调用,并可使用自定义数据进行微调以生成专用版本。模型输出受语法约束的标准格式数据,程序可直接使用。每次响应都包含置信度分数,用于决定本地处理还是云端回退。

@GitHub_Daily原推文1 张图片想给智能手表、家居这些小设备塞个 AI,几百 MB 的模型放不下,联网调接口又不安全。 Cactus 团队的 Needle 2 走了条极小路线,将 4500 万参数模型压成一个 14MB 文件,跑起来只吃 28MB 内存。 它专门干三件事,听懂指令去调工具、操作设备、从一段文字里抽出结构化数据。 输出被语法约束框着走,返回的一定是标准格式数据,程序拿来就能用。 每次回答还带一个把握分数,拿得准的自己办,拿不准的转给云端大模型,这个分工想得挺清楚。 GitHub:http://github.com/cactus-compute/needle Python 装上就能用,给函数写好说明它就知道什么时候调,还能用自己的数据轻量微调出专属版本。 在做智能硬件、机器人的朋友,这个体积的模型可以持续关注一下。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

想给智能手表、家居这些小设备塞个 AI,几百 MB 的模型放不下,联网调接口又不安全。 Cactus 团队的 Needle 2 走了条极小路线,将 4500 万参数模型压成一个 14MB 文件,跑起来只吃 28MB 内存。 它专门干三件事,听懂指令去调工具、操作设备、从一段文字里抽出结构化数据。 输出被语法约束框着走,返回的一定是标准格式数据,程序拿来就能用。 每次回答还带一个把握分数,拿得准的自己办,拿不准的转给云端大模型,这个分工想得挺清楚。 GitHub:http://github.com/cactus-compute/needle Python 装上就能用,给函数写好说明它就知道什么时候调,还能用自己的数据轻量微调出专属版本。 在做智能硬件、机器人的朋友,这个体积的模型可以持续关注一下。

背景
边缘 AI 是指在智能手表、家用电器和机器人等设备上直接运行机器学习模型,而不是在云端运行。工具调用是语言模型根据用户命令调用外部函数或 API 的能力。结构化提取是从非结构化文本中抽取特定数据字段并转换为预定义格式的过程。置信度评分是一种技术,模型估计自身输出的可靠性,从而在不确定时回退到更大的模型。量化(如 CQ2-bit)通过降低数值精度来减小模型大小,这对于将模型装入受限内存至关重要。

8月18日 13:30在 X 打开#edge AI #tiny ML #embedded systems #tool calling #structured data

117.0

JobSync:开源AI求职申请追踪工具,支持自托管

JobSync 是一个新的开源求职申请追踪工具,将申请状态、简历、面试题和待办事项整合到一处。它内置AI助手,可以审查简历、根据职位描述打分并撰写求职信。该工具支持从PDF或Word导入简历,自动提取工作经历和教育背景等字段,并可设置自动监控,定期抓取目标公司的新职位并与简历匹配。 求职过程中往往需要追踪大量申请的不同阶段,手动管理容易出错。JobSync 通过AI功能和自托管解决了这一痛点,让用户掌控自己的数据。对于重视隐私和工作流自动化的开发者和求职者来说,这款工具尤其有价值。 JobSync 在 GitHub 上以 MIT 许可证开源,可通过 Docker 一键部署。它支持通过 Ollama 连接本地AI模型,因此无需外部API密钥。AI可以从导入的简历中提取结构化字段,并与职位发布进行匹配。该项目为自托管,所有申请记录和简历都保存在用户自己的机器上。

@GitHub_Daily原推文1 张图片海量投简历的时候,哪家走到哪一轮、约了什么时间,全靠脑子和聊天记录硬记。 JobSync 把这摊事收进一套开源系统,投递进度、简历、面试题、待办都归到一处。 内置的 AI 助手能审简历,拿简历和岗位描述互相打分,顺手把求职信也写了。 简历从 PDF 或 Word 导入,AI 自动拆出工作经历、教育背景这些字段,核对一下就能存。 还能设自动盯岗,定期抓目标公司的新职位,和简历匹配后把合适的挑出来。 GitHub:http://github.com/Gsync/jobsync Docker 一键部署在自己机器上,投递记录和简历全在自己手里,AI 接本地 Ollama 模型也行。 正在投简历的朋友部署一套试试,比开表格记省心,数据还都在自己手里。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

海量投简历的时候,哪家走到哪一轮、约了什么时间,全靠脑子和聊天记录硬记。 JobSync 把这摊事收进一套开源系统,投递进度、简历、面试题、待办都归到一处。 内置的 AI 助手能审简历,拿简历和岗位描述互相打分,顺手把求职信也写了。 简历从 PDF 或 Word 导入,AI 自动拆出工作经历、教育背景这些字段,核对一下就能存。 还能设自动盯岗,定期抓目标公司的新职位,和简历匹配后把合适的挑出来。 GitHub:http://github.com/Gsync/jobsync Docker 一键部署在自己机器上,投递记录和简历全在自己手里,AI 接本地 Ollama 模型也行。 正在投简历的朋友部署一套试试,比开表格记省心,数据还都在自己手里。

背景
求职申请追踪涉及管理多个申请,每个申请都有自己的状态、截止日期和文档。自托管意味着在自己的服务器或计算机上运行软件,而不是使用云服务,从而完全掌控自己的数据。Ollama 是一个允许在本地运行大语言模型的工具,避免依赖云API。Docker 是一个用于打包和运行应用程序的平台,通过隔离容器简化部署。

8月18日 10:00在 X 打开#open-source #job-search #AI #productivity #self-hosting

127.0

DSH Desktop 将 DeepSeek Harness 封装为易用桌面应用

DSH Desktop 将 DeepSeek Harness 封装为开箱即用的桌面客户端,免去了手动配置环境和运行命令行的麻烦。该项目在 GitHub 上已获得超过 11000 颗星,并提供 Windows 和 macOS 安装包。它原样运行官方 Harness,自动启动本地服务,并管理窗口、托盘、终端和更新。 这降低了采用 DeepSeek Harness 的门槛,让那些因配置复杂而却步的开发者也能轻松使用。通过提供原生桌面体验,它有望扩大这个开源智能体框架的用户群,并加速 AI 智能体的实验。保持官方源码不被修改的设计选择也增强了信任并简化了维护。 桌面外壳本身作为一个 DSH 插件实现,因此没有修改任何官方源码。该应用使用真实的 Harness 设置和凭据 API,用户可以在初始设置时选择模型提供商并输入 API 密钥。手机远程控制功能目前正在开发中。项目地址为 https://github.com/anywhere-labs/deepseek-harness-desktop。

@GitHub_Daily原推文1 张图片不少朋友想试 DeepSeek Harness,一看要折腾环境配置、跑命令行,就先放下了。 DSH Desktop 直接把它封装为开箱即用的桌面客户端,已斩获 11000+ Star! 官方 Harness 原样跑在里面,本地服务自动启动,窗口、托盘、终端、更新都替我们管好。 设计上有个巧思,桌面外壳本身也是一个 DSH 插件,没魔改官方一行源码。 GitHub:http://github.com/anywhere-labs/deepseek-harness-desktop 提供 Windows、macOS 安装包,手机远程控制功能正在开发。 想尝鲜 DSH 又不想折腾环境的朋友,从这个入口进最省事。 --- From twitter --- 想要了解 DeepSeek Harness 对我们有什么用,可以看下《DeepSeek Harness 橙皮书》这本开源书籍。 看完后将会知道 DSH 能干什么,会不会花我们的钱,会不会乱动硬盘上的文件。 除此之外,还有完整系统提示词、129 行启动清单、三份一条事件都没删的原始会话日志。 GitHub:http://github.com/alchaincyf/deepseek-harness-orange-book 还有 AI 现场给自己造工具的 19 步全程,工具清单从 32 行变成 33 行,多的那行是它自己写的。 提供 PDF、EPUB、HTML 几种文件格式免费下载阅读,还配了 20 页浓缩版 PPT,没时间读全书的先翻这个。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

不少朋友想试 DeepSeek Harness,一看要折腾环境配置、跑命令行,就先放下了。 DSH Desktop 直接把它封装为开箱即用的桌面客户端,已斩获 11000+ Star! 官方 Harness 原样跑在里面,本地服务自动启动,窗口、托盘、终端、更新都替我们管好。 设计上有个巧思,桌面外壳本身也是一个 DSH 插件,没魔改官方一行源码。 GitHub:http://github.com/anywhere-labs/deepseek-harness-desktop 提供 Windows、macOS 安装包,手机远程控制功能正在开发。 想尝鲜 DSH 又不想折腾环境的朋友,从这个入口进最省事。 --- From twitter --- 想要了解 DeepSeek Harness 对我们有什么用,可以看下《DeepSeek Harness 橙皮书》这本开源书籍。 看完后将会知道 DSH 能干什么,会不会花我们的钱,会不会乱动硬盘上的文件。 除此之外,还有完整系统提示词、129 行启动清单、三份一条事件都没删的原始会话日志。 GitHub:http://github.com/alchaincyf/deepseek-harness-orange-book 还有 AI 现场给自己造工具的 19 步全程,工具清单从 32 行变成 33 行,多的那行是它自己写的。 提供 PDF、EPUB、HTML 几种文件格式免费下载阅读,还配了 20 页浓缩版 PPT,没时间读全书的先翻这个。

背景
DeepSeek Harness(dsh)是 DeepSeek AI 开发的开源智能体框架,基于 Cordis 插件系统构建,其中一切都是插件。它目前处于开发者预览阶段,并以 MIT 许可证发布。框架为 AI 智能体执行任务提供运行时环境和工具。DSH Desktop 是一个第三方封装,将该框架打包为原生桌面应用,免去了 Node.js 和手动依赖配置的需要。

8月18日 04:00在 X 打开#DeepSeek #Desktop App #Developer Tools #Open Source #AI