- OpenAI 推出 GPT-5.6 Sol 和 Luna,提升事实准确性与推理控制9.0
- PocketJS 将完整 AI 代理 pi harness 带到 ESP328.0
- 从5万书签中精选的S级计算机科学与AI交互教程8.0
- Qwen3.8-Max 在智能指数排名第五,智能体指数排名第一8.0
- OpenAI 与合作伙伴推出 Agent Plugins 开放标准,提升 AI 智能体互操作性8.0
- PlanetScale 通过并行分片恢复将 Postgres 备份恢复时间从 22 小时缩短至 42 分钟8.0
- Jeff Dean 离开谷歌,结束27年生涯创办 DiscoLoop AI8.0
- 卖微软Office如何亏掉上百万7.0
- 技术债务仅对长期存续的系统与有担当的工程师重要7.0
- Matt Pocock 称 AI 已消灭战术性编程7.0
- Hermes Desktop 新增内置浏览器,可由 AI 控制7.0
- 作家分享避免“AI味”的实用AI辅助写作流程7.0
019.0
OpenAI 推出 GPT-5.6 Sol 和 Luna,提升事实准确性与推理控制
OpenAI 发布了 GPT-5.6 Sol 和 Luna,为 ChatGPT 带来更高的事实准确性和新的推理控制功能。GPT-5.6 Sol 现已向 Plus 和 Pro 用户开放,提供更真实、更聚焦的回答,而 Free 和 Go 用户将从明天起获得基于 GPT-5.6 Luna 的无限文本对话。此外,Plus 和 Pro 用户还可以通过新的滑块调整 ChatGPT 在每次回答中投入的推理力度。 此次更新大幅减少了金融、医学和法律等高风险领域的事实错误,使 ChatGPT 在专业场景中更加可靠。推理力度滑块的引入让用户能更好地控制回答的深度与速度,满足从快速查询到复杂问题解决的多样化需求。通过向免费用户开放更先进的功能,OpenAI 降低了高质量 AI 的使用门槛,有望加速更广泛用户群体的采用。 在 OpenAI 的高风险事实性评估中,GPT-5.6 Sol 比 GPT-5.5 Instant 减少了 68% 的事实错误。新模型为付费用户的所有聊天(包括 Instant)提供支持,带来一致的体验。Free 和 Go 用户还可以使用“思考”按钮,在难题上获得更多推理。更新后的 GPT-5.6 Sol 仅在聊天体验中可用,而 Work 和 Codex 版本保持不变。
背景
GPT-5.6 是 OpenAI 大型语言模型系列的最新版本,继 GPT-5.5 之后推出。它分为三个层级:Sol(高级版)、Terra(中级版)和 Luna(高效版)。Sol 针对高质量、事实性回答进行了优化,而 Luna 则适用于清晰、高容量的工作。推理力度滑块是一项新功能,允许用户控制推理深度,类似于调整模型的“思考时间”。此次发布延续了 OpenAI 先向付费用户推出高级功能,再扩展到免费层的模式。
社区讨论
社区评论中有人将 GPT-5.6 Sol 与 Claude Opus-4.6 进行对比,指出在 SWE Verified 跑分上仅差 0.3%,引发了关于性能声明的讨论。一些用户质疑如此微小差距的意义,而另一些人则认为这体现了竞争均势。整体情绪谨慎乐观,对实际使用效果充满期待。
8月6日 18:35在 X 打开#OpenAI #GPT-5.6 #ChatGPT #AI model release #NLP
028.0
PocketJS 将完整 AI 代理 pi harness 带到 ESP32
PocketJS 推出了 Pocket Pi,这是一个基于 QuickJS 的极简 JavaScript 运行时,能让完整的 AI 代理(pi harness)在 ESP32 微控制器上运行。该代理可以进行对话、调用工具、管理工作区、设置日程,并通过动态加载 ESM 插件实现自我进化。这是在低功耗嵌入式设备上部署自主 AI 代理的一项突破。 这一进展大大降低了在边缘硬件上运行复杂 AI 代理的门槛,使得无需依赖云连接即可在物联网、机器人和智能设备中实现新应用。它证明了一个轻量级 JS 运行时可以支持复杂的代理循环和插件生态,可能重塑嵌入式 AI 的构建方式。自我进化能力以及跨多种 PocketJS 支持硬件的运行能力,开启了广泛的创意应用场景。 pi harness 在 ESP32 上运行,使用 PocketJS 基于 QuickJS 的定制运行时,该运行时针对最小资源占用进行了优化。它支持动态加载原生 ESM 插件,使代理能够即时扩展其能力。该代理包含内置 UI,可以安排任务,并通过代理循环自行唤醒。PocketJS 已支持多种设备,如 Game Boy、PSP 和 ESP32-P4,该代理可在其中任意设备上运行。
背景
PocketJS 是一个紧凑的 JavaScript 运行时系列,专为在非传统设备上构建应用而设计,从复古游戏机到微控制器。QuickJS 是一个小型、可嵌入的 JavaScript 引擎,编译后大小不到 1MB,适合资源受限的环境。pi harness 是一个极简的 AI 代理框架,强调 token 效率和适应性,通常用于编码辅助。ESP32 是一款流行的低成本、低功耗微控制器,具有 Wi-Fi 和蓝牙功能,广泛用于物联网项目。
社区讨论
社区对在嵌入式设备上运行 AI 代理的潜力感到兴奋,讨论中强调了自我进化插件和广泛硬件支持的新颖性。一些人对实际应用和性能限制表示好奇,而另一些人则将其视为迈向无处不在的 AI 的一步。原作者积极参与进一步激发了兴趣和合作。
8月6日 17:40在 X 打开#PocketJS #ESP32 #AI agent #embedded systems #QuickJS
038.0
从5万书签中精选的S级计算机科学与AI交互教程
一位Hacker News用户从5万多个书签中整理出了一份S级交互式教程和可视化列表,涵盖编程、AI/ML、计算机基础、图形学、数学和工程等领域。该列表由@dotey在X上分享,突出了AI时代前手工制作的教育内容。其中包括构建CPU的游戏、学习Git分支的游戏、Transformer解释器以及从零构建GPU的指南等资源。 这份精选合集保存了在AI生成内容时代可能变得稀缺的高质量手工教育资源。它为自学者、教育者和开发者通过交互式探索深入理解概念提供了宝贵参考。该列表也引发了关于AI如何改变未来教育内容创作的思考。 该列表按类别组织:互动游戏/动手学习、AI/机器学习、编程/计算机基础、图形学/游戏开发、数学/物理、工程/硬件。值得注意的条目包括从逻辑门构建CPU的“ChipBuilder”、交互式理解Transformer的“Transformer Explainer”,以及学习React内部原理的“Build Your Own React”。HN原帖位于https://news.ycombinator.com/item?id=49183198,这些资源均可免费在线访问。
背景
交互式教程和可视化是一种教育工具,允许学习者通过模拟或逐步演示直接操作概念,从而加深对复杂主题的理解。“S级”标签源于游戏文化,表示最高质量等级。Hacker News(HN)是一个专注于计算机科学和创业的社交新闻网站,用户经常在此分享和讨论技术资源。前AI时代指的是GPT等大语言模型广泛用于内容生成之前,教育内容主要由个人手工创作的时代。
8月6日 16:45在 X 打开#education #tutorials #visualization #AI #programming
048.0
Qwen3.8-Max 在智能指数排名第五,智能体指数排名第一
阿里巴巴的 Qwen3.8-Max 在 Artificial Analysis 智能指数中排名第五,该指数是领先 AI 模型的综合基准。它还在智能体指数中排名第一,该指数专门衡量工具使用和规划等智能体任务的性能。 这一里程碑展示了 Qwen3.8-Max 在通用智能和智能体工作流程方面的强大能力,使阿里巴巴成为 AI 领域的关键竞争者。在智能体指数上排名第一,凸显了其在自主任务执行方面的潜力,这对企业应用越来越重要。 Artificial Analysis 智能指数 v4.1 包括 GPQA Diamond 和 Humanity's Last Exam 等评估,而智能体指数侧重于工具使用和复杂问题解决。考虑到竞争激烈的领域,Qwen3.8-Max 的表现值得注意,但公告中未披露具体的基准分数。
背景
Artificial Analysis 智能指数是一个独立的综合基准,用于评估 AI 模型在推理、编码和科学问题解决等多个挑战性任务上的表现。智能体指数同样来自 Artificial Analysis,衡量模型执行智能体工作流程的能力,例如使用工具、规划和自主行动。Qwen3.8-Max 是阿里巴巴 Qwen 团队开发的大型语言模型,属于 Qwen 系列,该系列以在各种基准测试中的强劲表现而闻名。
8月6日 09:38在 X 打开#AI #Qwen #LLM #benchmark #Alibaba
058.0
OpenAI 与合作伙伴推出 Agent Plugins 开放标准,提升 AI 智能体互操作性
OpenAI 与 AWS、Cursor、GitHub、Microsoft 和 Vercel 联合推出了 Agent Plugins,这是一个用于打包 AI 智能体技能和 MCP 服务器配置的开放标准。该标准允许单个插件在多个兼容的智能体客户端上运行,包括 Codex 和 ChatGPT。该公告于 2025 年 5 月 14 日发布,标志着跨平台智能体兼容性迈出了重要一步。 该标准通过允许开发者构建一次插件即可在不同平台上部署,解决了 AI 智能体生态系统的碎片化问题。它可能加速基于智能体的工作流程的采用,并减少供应商锁定,使开发者和用户都受益。主要行业参与者的支持表明其具有广泛采用的潜力,类似于开放标准塑造网络的方式。 Agent Plugins 以共享格式打包智能体技能并支持 MCP(模型上下文协议)服务器配置。该标准是与 AWS、Cursor、GitHub、Microsoft 和 Vercel 合作开发的。它旨在与 Codex 和 ChatGPT 等智能体兼容,但插件格式的具体技术细节尚未完全披露。该倡议是开源的,鼓励社区贡献。
背景
AI 智能体是代表用户执行任务的自主程序,通常使用大型语言模型。MCP(模型上下文协议)是一个开放协议,标准化了应用程序向 LLM 提供上下文的方式,MCP 服务器向智能体公开工具和数据。目前,不同的智能体平台拥有专有的插件系统,使开发者难以创建跨平台扩展。Agent Plugins 旨在将这些统一在一个标准下,类似于 USB 标准化硬件连接的方式。
社区讨论
社区反应积极,开发者对跨平台兼容性的潜力表示兴奋。一位用户指出他们期待“尽快推出 mattpocock/skills 插件”,表明对社区驱动的技能包有需求。总体情绪乐观,认为这是智能体生态系统的必要步骤。
8月6日 18:29在 X 打开#AI agents #open standard #interoperability #MCP #OpenAI
068.0
PlanetScale 通过并行分片恢复将 Postgres 备份恢复时间从 22 小时缩短至 42 分钟
PlanetScale 展示了通过为每个分片使用一个临时节点并行恢复 32 TB 的 Postgres 数据库,备份恢复时间从单流的约 22 小时降至 32 个并行分片的仅 42 分钟。相同约 40 TB 的数据以每个节点 500 MB/s 的速度传输,但并行化允许每个分片独立重放 WAL。该方法在其工程博客文章中详细说明。 这一突破大幅缩短了大规模 Postgres 部署的停机时间,实现了更快的灾难恢复并最小化业务影响。它展示了分片不仅可用于扩展,还可用于提升运维效率,为云数据库的备份性能树立了新标杆。管理数 TB 级数据库的运维人员和 DevOps 团队将直接受益于此类技术。 测试涉及 32 TB 数据库,每个节点以 500 MB/s 的速度恢复数据。单流恢复耗时约 22 小时,8 个并行分片缩短至约 2.8 小时,32 个分片仅需约 42 分钟。加速源于为每个分片使用一个临时节点,各自独立恢复其数据部分并重放 WAL 日志。传输的总数据量保持约 40 TB,表明存在一些开销或压缩。
背景
Postgres 使用预写日志(WAL)确保数据完整性;恢复期间必须重放 WAL 记录以使数据库达到一致状态。分片将数据库拆分为更小的独立片段(分片),可并行处理。PlanetScale 是一个云数据库平台,以其基于 Vitess 的水平可扩展 MySQL 和 Postgres 产品而闻名。传统备份恢复通常受 I/O 限制和单节点吞吐量制约,导致大型数据库恢复耗时较长。
8月6日 09:58在 X 打开#Postgres #backups #sharding #performance #PlanetScale
078.0
Jeff Dean 离开谷歌,结束27年生涯创办 DiscoLoop AI
谷歌首席科学家、早期员工 Jeff Dean 宣布在任职27年后离职。他将与长期同事 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创办一家名为 DiscoLoop AI 的新 AI 初创公司。这一消息通过个人推文和内部备忘录分享,回顾了他从谷歌第30号员工到帮助打造数十亿用户产品的历程。 Jeff Dean 是计算机科学领域的传奇人物,共同创建了 MapReduce、BigTable 和 TensorFlow 等支撑现代 AI 和云基础设施的基础系统。他与多位顶尖 AI 研究员的离开,标志着人才从大科技公司向初创企业的重要转移,可能加速新 AI 企业的创新。这也象征着一个时代的结束,他帮助谷歌从一家小型搜索公司成长为全球科技巨头。 Dean 于1999年加入谷歌,是第30号员工,最近担任首席科学家,此前在2018至2023年领导谷歌 AI。他的新公司 DiscoLoop AI 的联合创始人包括 Sanjay Ghemawat(MapReduce 和 BigTable 的共同创建者)、Oriol Vinyals(Gemini 联合负责人)和 Quoc Le(seq2seq 和 Transformer 的共同发明者)。内部备忘录提到谷歌现有13款产品拥有超过10亿用户,彰显了他的影响力。目前尚未披露 DiscoLoop AI 的重点或融资细节。
背景
Jeff Dean 以其在大规模分布式系统和机器学习方面的工作而闻名。他共同设计了 MapReduce(一种处理大数据的编程模型)和 BigTable(一种分布式存储系统),这些成为谷歌基础设施的核心,并启发了 Hadoop 等开源项目。他还共同创建了广泛使用的机器学习框架 TensorFlow,并对 Transformer 架构等 AI 进步做出了贡献。他在谷歌 AI 和 Google DeepMind 的领导地位使他处于公司 AI 战略的中心,包括 Gemini 模型系列的开发。
8月6日 04:21在 X 打开#Jeff Dean #Google #AI #industry news #leadership
087.0
卖微软Office如何亏掉上百万
软件经销商「数码荔枝」的创始人分享了一段亲身经历,讲述了他们成为微软Office官方经销商后亏损超过一百万元人民币的详细过程。故事揭示了经销商计划中隐藏的财务陷阱,包括激进的销售目标和导致负现金流的返点模式。公司最终通过家人注资才得以生存,但这段经历留下了持久的警惕。 这个警示故事揭示了小企业在与大型科技供应商合作时面临的风险,激励结构可能导致不可持续的价格战和财务压力。它强调了在扩大经销商业务之前理解合同条款、现金流影响和市场动态的重要性。这个故事引起了软件生态系统中企业家的共鸣,他们可能会遇到类似带有隐藏成本的「机会」。 该公司最初以成本价销售Office 365以获取市场,随后签订了核心经销商协议,要求销量增长10倍。返点模式意味着他们以每套100元的价格预付,以90元出售,获得的20元返点只能用于未来进货,形成了现金流陷阱。季度返点取决于是否达到销售目标,导致经销商为了达标而亏本销售,陷入恶性竞争。
背景
2015年前后,微软为了在中国迅速铺量,对Office 365订阅采取了极其激进的定价,年费低至30-50元。经销商计划采用「提货+返点」模式,合作伙伴需预先购买许可证,之后获得返点,通常与销售目标挂钩。这种结构可能对现金流造成压力,尤其是对于在非官方或灰色市场密钥导致价格低于官方成本的市场中竞争的小经销商。
8月6日 16:07在 X 打开#business #Microsoft #reseller #startup #cautionary tale
097.0
技术债务仅对长期存续的系统与有担当的工程师重要
Grady Booch 在推文中(由 Bilgin Ibryam 转发)简明扼要地分享了对技术债务的见解。他指出,对于短期应用,技术债务无关紧要;但对于长期存续的系统,它会严重拖慢演进并带来安全风险。不过,他补充了一个务实的转折:即使在关键系统中,如果你打算离职,技术债务也可能无关紧要。 这段评论揭示了工程最佳实践与现实职业激励之间的张力。它引起了那些面临快速交付压力、常常牺牲长期代码质量的开发者的共鸣。这一见解促使人们反思组织文化和个人责任感如何影响技术决策。 Booch 区分了“应用”和“系统”两个层面:一次性应用可以容忍债务,但系统无法轻易抛弃,因此债务会累积并阻碍进展。最后关于离职的评论强调,技术债务不仅是技术问题,也是与个人激励相关的社会经济问题。
背景
技术债务是 Ward Cunningham 提出的隐喻,指因选择当前容易的方案而非更耗时的更好方法,而导致未来需要额外返工的隐含成本。它常表现为快速修复、过时的库或糟糕的架构,拖慢未来开发。在软件工程中,管理技术债务是速度与可维护性之间的持续权衡。Grady Booch 是著名软件架构师、UML 联合创始人,以对软件设计的深刻见解而闻名。
8月6日 13:49在 X 打开#technical debt #software engineering #system design #career
107.0
Matt Pocock 称 AI 已消灭战术性编程
在最近的 UnhandledException 播客节目中,开发者教育者 Matt Pocock 表示 AI 已经完全接管了战术性编程,即那些常规的、以实现为主的编码任务现在都由 AI 处理。这一转变引发了关于当 AI 能编写所有代码时,技术编程面试该如何进行的根本性问题。 这一观点凸显了软件工程领域的重大转变,AI 工具正在自动化底层编码任务,可能重塑工作角色和技能要求。它挑战了传统的编程面试模式,迫使行业重新思考如何评估开发者的能力,而不仅仅是代码生成。 该讨论是 UnhandledException 播客第 88 期的一部分,嘉宾是以 TypeScript 专业知识闻名的 Matt Pocock。‘战术性编程’一词指的是专注于即时实现而非战略设计的日常编码任务。未提及具体的 AI 工具或基准,但上下文暗示了像 GitHub Copilot 或 ChatGPT 这样的通用 AI 编码助手。
背景
战术性编程是一个术语,用于描述专注于快速完成任务而往往牺牲长期可维护性的编码方式,与强调设计和架构的战略性编程相对。AI 编码助手发展迅速,能够生成样板代码、修复错误,甚至根据自然语言提示创建整个函数。这引发了关于人类程序员未来角色以及传统编程面试(在时间压力下测试算法问题解决能力)有效性的辩论。
8月6日 07:02在 X 打开#AI #programming #coding interviews #software engineering
117.0
Hermes Desktop 新增内置浏览器,可由 AI 控制
Nous Research 推出的 AI 助手 Hermes Desktop 现在内置了一个浏览器,AI 可以直接控制并感知其内容。这一功能扩展了助手自主与网页内容交互的能力。该更新通过一条引用原始公告的推文宣布。 这一增强使 Hermes Desktop 能够更无缝地执行基于网络的任务,例如代表用户填写表单、抓取数据或浏览网站。它反映了 AI 代理直接控制应用程序的更广泛趋势,超越了简单的聊天界面。用户现在可以在不离开 Hermes 环境的情况下自动化复杂的浏览器工作流程。 内置浏览器直接集成在 Hermes Desktop 中,这意味着 AI 完全了解页面内容,并可以执行点击和输入等操作。这类似于其他 AI 浏览器控制工具,如 Browser MCP 或 Ritemark 的内置浏览器代理。公告中未透露有关底层引擎或安全措施的具体技术细节。
背景
Hermes Desktop 是由 Nous Research 开发的原生 AI 助手应用程序,适用于 macOS、Windows 和 Linux。它是 Hermes Agent 项目的一部分,该项目旨在创建一个可以与用户系统交互的独立代理。添加由 AI 控制的内置浏览器符合 AI 代理自动化网络交互的日益增长的领域,类似于 Browser Use 等项目。Nous Research 以其在开源 AI 模型和工具方面的工作而闻名。
8月6日 20:39在 X 打开#AI assistant #browser #Hermes #feature update #NousResearch
127.0
作家分享避免“AI味”的实用AI辅助写作流程
一位X平台上的作家分享了AI生成文本的局限性,指出即使使用专门的“技能”来消除AI味,输出内容最终仍会显得不自然。他们提出了一种工作流程:将AI用于翻译、资料收集、讨论和结构调整,但核心写作仍由人类主导。关键方法是先写一份凌乱的草稿,再让AI按照原始风格重写,以改善流畅度而不丢失个人风格。 这一观点回应了作家和读者普遍的不满:AI生成的内容往往缺乏真实感,容易被识别。所提出的工作流程提供了一种平衡的方法,利用AI在结构和灵感方面的优势,同时保留人类的创造力。它凸显了将AI作为协作工具而非替代品的增长趋势,这可能影响未来的内容创作实践。 作者强调,无论模型质量或技能如何优化,AI都无法替代人类写作。推荐的过程是:先写一份混乱的草稿,让AI按照原始风格重写,可选地让不同AI生成多个版本,然后手动取长补短。该方法通过使用AI处理过渡段落和提供灵感来克服写作障碍,但最终输出保留了作者的独特声音。
背景
像GPT-4这样的大语言模型(LLM)在海量文本语料上训练,能生成类似人类的文本,但经常产生重复、过于结构化或别扭的措辞,即所谓的“AI味”。许多工具和“技能”(自定义提示或微调模型)声称能减少这种效果,但作者认为这只是暂时的。“AI辅助写作”的概念涵盖从全自动生成到协作编辑,越来越多的社区在探索混合工作流程以保持真实性。
8月6日 16:30在 X 打开#AI writing #AI-assisted writing #writing workflow #LLM limitations #content creation