- Claude 自主设计出 15 个靶点中 14 个的新型蛋白结合剂9.0
- Qwen3.8-27B:首个达到前沿AI性能的本地模型9.0
- Jason Wei:小模型加工具无法匹敌大模型的智能8.0
- Z.ai 发布 GLM-5.3 API,面向编程、网络安全和智能体任务8.0
- OpenAI 暂停前沿模型强化学习训练以强化安全措施8.0
- 知名开发者力挺云端AI代理,称本地开发或成过去式8.0
- AI 转向后训练与编程产品数据飞轮7.0
- 豆包Agent更新模仿Codex,支持GUI电脑操作与手机远程控制7.0
- Consent-O-Matic:开源浏览器扩展自动处理 Cookie 同意弹窗7.0
- Needle 2:面向微型边缘设备的14MB、4500万参数智能体模型7.0
- JobSync:开源AI求职申请追踪工具,支持自托管7.0
- DSH Desktop 将 DeepSeek Harness 封装为易用桌面应用7.0
019.0
Claude 自主设计出 15 个靶点中 14 个的新型蛋白结合剂
Anthropic 宣布,Claude 在人类专家撰写的蛋白质设计提示下,自主针对 15 个靶点中的 14 个设计出了新型蛋白结合剂。这些设计的蛋白质由 Adaptyv Bio 和 Twist Bioscience 独立构建并测试,验证了结果。这表明在自动化从头蛋白结合剂设计方面迈出了重要一步。 这一突破可能大幅加速药物发现,因为设计紧密结合的分子传统上是每个靶点需要数周或数月专家工作的瓶颈。如果 Claude 能可靠地设计功能性结合剂,它可能降低药物研究的成本和时间,使 AI 成为生物技术的核心工具。两家公司的独立验证增加了这一说法的可信度。 成功率为 15 个靶点中的 14 个,但公告中未披露具体的结合亲和力、靶点身份和实验细节。设计过程依赖于人类专家的提示,因此尚未实现完全自主。验证由 Adaptyv Bio 和 Twist Bioscience 完成,但推文中未提供定量基准。公告链接到 Anthropic 的研究页面,可能包含更多细节。
背景
蛋白结合剂是附着于特定靶点的分子,通常用于阻断或改变其功能,在药物开发中至关重要。从头设计意味着不基于现有天然蛋白质,从零开始创建这些结合剂。传统方法需要大量的实验筛选和专家迭代,但最近的 AI 模型如 RFdiffusion 和 BindCraft 在自动化这一过程方面显示出前景。Claude 是 Anthropic 开发的大型语言模型,这一公告表明它可以应用于文本生成之外的蛋白质设计任务。
8月18日 22:30在 X 打开#AI #drug discovery #protein design #Claude #biotech
029.0
Qwen3.8-27B:首个达到前沿AI性能的本地模型
阿里巴巴通义千问发布了Qwen3.8-27B,这是一个270亿参数的稠密模型,在Artificial Analysis智能指数上获得52分,与DeepSeek V4-Pro和GPT-5.6 Luna等前沿模型性能相当。这是本地模型首次达到前沿水平的能力,Cline和社区演示也强调了这一点,显示其在创意任务上超越了Gemini-3.7-flash。 这一里程碑改变了AI部署格局,使前沿水平的智能可以在消费级硬件上运行,减少了对云API的依赖并降低了成本。它可能为开发者、研究人员和注重隐私的用户普及先进AI能力,并加速边缘计算和设备端AI的创新。 Qwen3.8-27B是一个拥有270亿参数的稠密模型,采用混合注意力架构,64层中只有16层运行完整注意力。它可以在单张RTX 3090 GPU上以Q5量化运行,甚至可以通过自定义WebGPU内核在浏览器中运行。该模型通过Qwen3_5ForConditionalGeneration加载以实现软件兼容,其长上下文服务可能需要超出加载权重的大量内存。
背景
Artificial Analysis智能指数是一个综合基准,衡量推理、编码、知识、指令遵循、科学推理和多步骤任务能力。本地模型在用户硬件上运行,具有隐私和成本优势,但通常落后于前沿云模型。Qwen是阿里巴巴的开源模型系列,以具有竞争力的性能著称。Qwen3.8-27B是一个稠密变体,意味着推理时所有参数都处于激活状态,不同于混合专家模型。
社区讨论
社区反应非常积极,用户对该模型的创意能力表示惊叹,例如生成视觉惊艳的水面模拟,击败了Gemini-3.7-flash。一些人指出本地模型进步的速度令人惊讶,另一些人则强调在单张3090 GPU上运行的实用性。人们对开源权重模型与专有前沿系统竞争的前景感到兴奋。
8月18日 04:15在 X 打开#AI #local model #Qwen #frontier performance #breakthrough
038.0
Jason Wei:小模型加工具无法匹敌大模型的智能
思维链提示技术的核心作者之一 Jason Wei 发布新推文,反驳“小模型+工具”路线。他认为仅靠 10 亿参数的认知核心加外部工具(如联网搜索、执行代码)无法达到顶级智能。他以自己学习羽毛球的亲身经历作类比,说明内化知识与临时检索之间的差距。 这场辩论直接影响 AI 发展路线:是继续扩大模型规模,还是走工具增强的小模型路线。Wei 的观点强化了“苦涩的教训”——扩大算力和数据带来的能力提升胜过精巧的工程设计。这会影响 AI 实验室的资源分配,以及需要高质量推理的应用产品设计。 Wei 给出三个具体理由:速度(直接回答比调用工具快)、理解深度(大模型基于海量数据给出综合判断,小模型只能搬运搜索结果前几条)、可靠性(反复查资料和推导出错概率更高,长任务中错误会累积)。他还指出 10 亿参数模型能内化的知识有上限,即使 1 万亿参数也可能不够。
背景
思维链(CoT)提示是一种鼓励大语言模型生成中间推理步骤的技术,能显著提升复杂任务的表现。Jason Wei 是 CoT 的关键研究者之一。“苦涩的教训”是 Rich Sutton 的一篇文章,认为利用算力的通用方法始终胜过依赖人类设计知识的方法。扩大模型规模与用工具增强小模型之间的辩论,一直是 AI 战略讨论的核心。
8月18日 14:12在 X 打开#AI #language models #scaling #tools #Jason Wei
048.0
Z.ai 发布 GLM-5.3 API,面向编程、网络安全和智能体任务
Z.ai 发布了 GLM-5.3 API,这是一款针对编程、防御性网络安全和长周期智能体任务进行优化的大型语言模型。其价格与上一代 GLM-5.2 相同,可通过官方 API 和合作伙伴模型网关使用。 此次发布让开发者在不增加成本的情况下,获得了一款在复杂软件工程和自主智能体工作流方面能力更强的模型。对防御性网络安全的关注,回应了 AI 辅助安全运营日益增长的需求;而对长周期智能体的支持,则让多步骤自动化更加可靠。 GLM-5.3 是一款大规模推理模型,拥有 100 万 token 的上下文窗口,在编程能力以及性能与 token 效率的平衡方面优于 GLM-5.2。它支持文本输入和输出,可通过 OpenRouter 及其他合作伙伴网关使用。部分第三方文档指出,Z.ai 自身的通用 API 访问仍标记为“即将推出”,因此不同平台的可用性可能有所不同。
背景
GLM(通用语言模型)是 Z.ai 开发的一系列大型语言模型,该公司以提供开源和 API 可访问的 AI 模型而闻名。长周期智能体任务指的是 AI 智能体在较长时间内自主执行多个相互依赖步骤的复杂工作流,例如多阶段研究或软件工程。防御性网络安全是指利用 AI 检测、预防和响应威胁,从被动安全转向主动安全。100 万 token 的上下文窗口使模型能够在单次请求中处理非常长的文档或代码库。
8月18日 20:46在 X 打开#AI #LLM #API #coding #cybersecurity
058.0
OpenAI 暂停前沿模型强化学习训练以强化安全措施
OpenAI 宣布暂时暂停其最新待部署模型的强化学习(RL)训练,为期两周。在此期间,公司强化并对研究环境进行了红队测试,同时扩大了监控覆盖范围。最大规模的前沿 RL 训练计划仍处于暂停状态,等待小规模训练和评估验证新的安全措施。 此举表明 OpenAI 将内部开发风险与外部部署风险同等重视,尤其是在模型能力不断增强的背景下。这可能为其他 AI 实验室树立先例,促使它们采取类似的安全暂停措施,并影响前沿模型开发的行业规范。此次暂停也凸显了在扩大训练规模之前获取对齐证据的重要性。 暂停持续两周,专门针对待部署模型的 RL 训练。OpenAI 最大规模的前沿 RL 训练计划仍处于暂停状态,而小规模训练和评估正被用于验证安全措施并收集对齐证据。公告引用了关于控制模型开发节奏以应对网络能力风险的博客文章,表明对网络安全领域滥用的担忧。
背景
强化学习(RL)是一种机器学习范式,智能体在环境中学习采取行动以最大化奖励信号。AI 红队测试是一种对抗性测试,旨在部署前暴露漏洞、偏见和安全缺口。前沿模型是能力极强、通用性高的 AI 系统,处于当前能力的最前沿。OpenAI 的暂停反映了行业日益增长的趋势,即在开发阶段而非仅在发布前实施安全措施。
8月18日 18:13在 X 打开#AI safety #OpenAI #reinforcement learning #model deployment #frontier models
068.0
知名开发者力挺云端AI代理,称本地开发或成过去式
知名开发者 Matt Pocock 公开赞同 Jared Palmer 的观点,后者表示自己已经“极度痴迷云端代理”,自加入 Devin 的开发商 Cognition 以来,甚至没有配置过本地开发环境。Palmer 声称,通过 Slack 和网页应用使用 Devin 进行开发,在各个方面都优于本地开发,即使是前端工作也是如此。Pocock 补充说,未来我们会把“一个开发者、多个终端”的时代视为一段尴尬的过渡期。 来自有影响力的开发者的背书,预示着软件开发可能发生范式转变:云端AI代理或将取代传统的本地开发环境。如果这一趋势持续下去,可能会颠覆开发者工具、IDE和工作流程,并加速 Devin 等自主编码代理的普及。这种转变还可能改变工程团队的协作方式和资源分配。 Jared Palmer 是一位知名开发者,加入了自主AI软件工程师 Devin 背后的公司 Cognition。他特别提到在 Slack 中与同事一起使用 Devin,以及通过网页应用使用,并表示自己无需配置本地开发环境。这条推文没有提供具体的基准测试或量化对比,其说法基于个人经验而非对照研究。Devin 的定位是帮助工程团队将完整任务交给自主代理处理。
背景
Devin 是由 Cognition AI 开发的自主AI软件工程师,旨在端到端地处理完整的编码任务,包括规划、编写代码和调试。云端AI代理运行在远程服务器上,通过网页界面或 Slack 等聊天平台访问,无需配置本地环境。传统的本地开发需要在开发者自己的机器上设置 IDE、终端和依赖项。“一个开发者、多个终端”指的是单个开发者管理多个终端窗口以处理不同任务的常见做法,而云端代理旨在将其整合。
8月18日 05:56在 X 打开#AI agents #cloud development #Devin #developer tools #future of work
077.0
AI 转向后训练与编程产品数据飞轮
该推文讨论了 AI 模型进步正从参数规模扩展转向基于真实任务数据的后训练。它强调像 ZCode 这样的编程产品可以作为数据入口,形成“产品使用→数据→模型升级→更多使用”的飞轮。讨论引用了高盛关于 GLM-5.3 的报告,指出其参数规模基本不变(约 744B),但通过更长任务环境、强化学习和工具协同提升了代码、长任务执行和安全能力。 这一转变意味着竞争优势将越来越多地来自专有的真实任务数据,而非单纯的模型规模。对于 AI 公司而言,编程产品成为既能变现又能生成训练数据的战略资产。投资者应关注三个转化率——模型能力到用户使用量、用户使用量到付费收入、真实任务数据到下一代模型能力——而非仅仅看基准分数。 GLM-5.3 与 GLM-5.2 使用相同的基础模型,所有提升均来自后训练,参数规模为 7430 亿。ZCode 是 GLM-5.3 的官方集成环境,将模型与 AI 编程代理及现有工具结合。推文强调技术突破只能解释产品为何更强,估值最终取决于收入增速、付费率和利润率。
背景
后训练是指在初始预训练之后进行的额外训练,通常使用强化学习或精选数据来提升特定能力。数据飞轮是一种自我强化的循环:产品使用产生数据,数据改进模型,从而吸引更多用户。GLM-5.3 是 Z.ai(原智谱 AI)推出的大语言模型,定位为顶级开源权重编程模型。ZCode 是围绕 GLM 模型构建的 AI 驱动开发环境,与 Cursor、GitHub Copilot 等工具竞争。
8月18日 14:44在 X 打开#AI #post-training #data flywheel #GLM-5.3 #business strategy
087.0
豆包Agent更新模仿Codex,支持GUI电脑操作与手机远程控制
豆包推出重大更新,在Windows桌面应用中加入了类似Codex的GUI电脑操作和手机远程控制功能。新的“豆包虚拟桌面”功能允许AI独立操作电脑,而不会占用用户的鼠标和键盘。用户现在可以通过手机上的豆包应用远程控制电脑,完成查找文档并发送到飞书等任务。 此次更新使豆包在中国市场成为OpenAI Codex的有力竞争者,因为ChatGPT和Claude在中国无法使用。通过提供不干扰用户当前工作的虚拟桌面,豆包解决了Claude Code的Computer Use的一个关键痛点。手机远程控制功能将Agent能力扩展到用户不在电脑旁的场景,充分利用桌面环境的全部资源。 虚拟桌面基于GUI能力,无需MCP、API、插件或CLI。它在相对独立的环境中运行,用户可以实时查看操作步骤,并随时暂停或接管任务。手机远程控制需要在手机和电脑上登录相同账号,且电脑必须允许手机连接。该功能目前仅在Windows上可用;Mac仅支持内置浏览器内的GUI操作。
背景
豆包是字节跳动的AI助手,类似于ChatGPT。Codex是OpenAI的智能编码工具,最近增加了电脑操作功能,使其能够操作桌面应用程序。Claude Code是Anthropic基于终端的编码助手,具有电脑操作预览功能。GUI电脑操作使AI代理能够通过图形界面与软件交互,如点击按钮和填写表单,而无需API或命令行工具。
8月18日 05:48在 X 打开#AI Agent #Doubao #Computer Use #Remote Control #Product Review
097.0
Consent-O-Matic:开源浏览器扩展自动处理 Cookie 同意弹窗
Consent-O-Matic 是一个开源浏览器扩展,可根据用户偏好自动填写 Cookie 同意弹窗。它支持 200 多种常见的同意管理组件,并由开源社区积极维护。该扩展可用于 Chrome、Firefox、Edge,甚至 iOS 上的 Safari。 Cookie 同意弹窗普遍令人烦恼,且常使用暗黑模式诱导用户接受追踪。Consent-O-Matic 自动处理这些弹窗,为用户节省时间、减少烦恼,同时增强隐私保护。Mozilla 和荷兰数据保护机构的推荐增加了其可信度。 该扩展由奥胡斯大学高级可视化与交互中心(CAVI)开发。它能识别 CMP(同意管理提供商)弹窗,并根据用户偏好自动填写,即使遇到暗黑模式也能处理。处理完成后,图标旁会显示一个小对勾,用户可点击图标为特定网站单独关闭该功能。规则由开源社区持续更新。
背景
根据 GDPR 和 ePrivacy 指令等法规,网站在存储追踪 Cookie 前必须获得用户同意,因此出现了 Cookie 同意弹窗。同意管理平台(CMP)提供这些弹窗,但许多使用暗黑模式诱导用户点击“全部同意”。像 Consent-O-Matic 这样的浏览器扩展充当中间人,根据用户偏好自动选择隐私友好的选项。该扩展是开源的,代码公开,任何人都可以审计或贡献。
8月19日 00:00在 X 打开#open-source #privacy #browser-extension #cookie-consent #tools
107.0
Needle 2:面向微型边缘设备的14MB、4500万参数智能体模型
Cactus Compute 发布了 Needle 2,这是一个开放的 4500 万参数模型,用于工具调用、设备使用和结构化提取。整个模型是一个 14MB 的二进制文件,完整会话仅需约 28MB 内存即可运行。它基于 Cactus 的 Simple Attention Network 构建,并压缩至 CQ2-bit 精度。 该模型使可穿戴设备、智能家居设备和机器人能够实现端侧 AI,在这些场景中,大型模型无法部署,而云端 API 又会带来隐私和延迟问题。其置信度评分机制允许对高置信度任务进行本地执行,对不确定任务回退到云端,从而平衡自主性与可靠性。这有望加速嵌入式系统中智能体 AI 的采用。 Needle 2 是开源的,可在 GitHub 上获取,并支持通过 Python 安装立即使用。它通过提供函数描述来支持函数调用,并可使用自定义数据进行微调以生成专用版本。模型输出受语法约束的标准格式数据,程序可直接使用。每次响应都包含置信度分数,用于决定本地处理还是云端回退。
背景
边缘 AI 是指在智能手表、家用电器和机器人等设备上直接运行机器学习模型,而不是在云端运行。工具调用是语言模型根据用户命令调用外部函数或 API 的能力。结构化提取是从非结构化文本中抽取特定数据字段并转换为预定义格式的过程。置信度评分是一种技术,模型估计自身输出的可靠性,从而在不确定时回退到更大的模型。量化(如 CQ2-bit)通过降低数值精度来减小模型大小,这对于将模型装入受限内存至关重要。
8月18日 13:30在 X 打开#edge AI #tiny ML #embedded systems #tool calling #structured data
117.0
JobSync:开源AI求职申请追踪工具,支持自托管
JobSync 是一个新的开源求职申请追踪工具,将申请状态、简历、面试题和待办事项整合到一处。它内置AI助手,可以审查简历、根据职位描述打分并撰写求职信。该工具支持从PDF或Word导入简历,自动提取工作经历和教育背景等字段,并可设置自动监控,定期抓取目标公司的新职位并与简历匹配。 求职过程中往往需要追踪大量申请的不同阶段,手动管理容易出错。JobSync 通过AI功能和自托管解决了这一痛点,让用户掌控自己的数据。对于重视隐私和工作流自动化的开发者和求职者来说,这款工具尤其有价值。 JobSync 在 GitHub 上以 MIT 许可证开源,可通过 Docker 一键部署。它支持通过 Ollama 连接本地AI模型,因此无需外部API密钥。AI可以从导入的简历中提取结构化字段,并与职位发布进行匹配。该项目为自托管,所有申请记录和简历都保存在用户自己的机器上。
背景
求职申请追踪涉及管理多个申请,每个申请都有自己的状态、截止日期和文档。自托管意味着在自己的服务器或计算机上运行软件,而不是使用云服务,从而完全掌控自己的数据。Ollama 是一个允许在本地运行大语言模型的工具,避免依赖云API。Docker 是一个用于打包和运行应用程序的平台,通过隔离容器简化部署。
8月18日 10:00在 X 打开#open-source #job-search #AI #productivity #self-hosting
127.0
DSH Desktop 将 DeepSeek Harness 封装为易用桌面应用
DSH Desktop 将 DeepSeek Harness 封装为开箱即用的桌面客户端,免去了手动配置环境和运行命令行的麻烦。该项目在 GitHub 上已获得超过 11000 颗星,并提供 Windows 和 macOS 安装包。它原样运行官方 Harness,自动启动本地服务,并管理窗口、托盘、终端和更新。 这降低了采用 DeepSeek Harness 的门槛,让那些因配置复杂而却步的开发者也能轻松使用。通过提供原生桌面体验,它有望扩大这个开源智能体框架的用户群,并加速 AI 智能体的实验。保持官方源码不被修改的设计选择也增强了信任并简化了维护。 桌面外壳本身作为一个 DSH 插件实现,因此没有修改任何官方源码。该应用使用真实的 Harness 设置和凭据 API,用户可以在初始设置时选择模型提供商并输入 API 密钥。手机远程控制功能目前正在开发中。项目地址为 https://github.com/anywhere-labs/deepseek-harness-desktop。
背景
DeepSeek Harness(dsh)是 DeepSeek AI 开发的开源智能体框架,基于 Cordis 插件系统构建,其中一切都是插件。它目前处于开发者预览阶段,并以 MIT 许可证发布。框架为 AI 智能体执行任务提供运行时环境和工具。DSH Desktop 是一个第三方封装,将该框架打包为原生桌面应用,免去了 Node.js 和手动依赖配置的需要。
8月18日 04:00在 X 打开#DeepSeek #Desktop App #Developer Tools #Open Source #AI