8月26日2026 · 星期三

从 27 条抓取中筛选 12 条 · twitter × 7 账号 · 00:47 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. 豆包工作:字节跳动新推出的办公 Agent 平台8.0
  2. 以Qwen为首的中国开源大模型在研究引用中超越美国模型8.0
  3. Qwen3.8-27B 在 Code Arena WebDev 排名第9,是同级尺寸中唯一进入前十的模型8.0
  4. 39家顶级科技公司300多篇工程博客文章精选清单8.0
  5. OpenAI 公布与 Cerebras 合作定制推理芯片 Jalapeño 的强劲成果8.0
  6. Apodex 1.1:开源AI Agent框架与35B模型,主打深度研究7.0
  7. 微软 AI Engineer Coach 分析本地 AI 编码日志,识别反模式7.0
  8. OpenAI 推出 100 美元的 ChatGPT Business 高级席位7.0
  9. OpenAI 将恢复 ChatGPT Plus 的 5 小时使用限制7.0
  10. Anthropic 将让 Claude Code 更易定制,支持 Agents.MD7.0
  11. LangChain:将任务规范与实现分离,打造可复用的编码智能体7.0
  12. 评估需要区分力来分辨有实质差异的AI系统7.0
018.0

豆包工作:字节跳动新推出的办公 Agent 平台

字节跳动发布了“豆包工作”,这是一个独立的办公 Agent 平台,与豆包桌面版使用同一套程序和模型。它支持文档、表格、PPT、图片、视频、网页和应用等多种内容生成与编辑,并与飞书深度集成。该产品定位为独立的办公 Agent 工作台,类似 Codex,登录或更新即可获得 30 天免费订阅。 这标志着字节跳动正式进入企业办公 Agent 市场,该领域已有阿里、腾讯和百度激烈竞争。作者认为 Agent 正在成为新的工作入口,用户习惯从打开应用转向打开 Agent。关键的竞争优势在于组织上下文数据,而飞书天然拥有这些数据,为豆包工作提供了潜在的护城河。 该产品支持“指哪改哪”的 AI 协作编辑,用户可对任意内容定点修改,而非反复重新生成,既节省算力又提升速度。它与飞书现有的权限和身份体系集成,Agent 访问会继承组织的访问控制。作者强调企业级 Agent 必须尊重权限,不同于个人场景下随意分享 API Key。据报道,该产品预计于 2026 年 8 月 29 日上线。

@dotey原推文1 张图片豆包今天发布了“豆包工作”,它和豆包桌面版应该是同一套程序和模型,但定位变了一个独立的办公 Agent 工作台。 豆包工作体验做的很好,有点像 Codex,能开项目、连接各种办公应用(尤其是飞书),体验后的一点感想: 一、用户的习惯正在发生变化,Agent 正在变成工作的入口 我发现自己处理工作时,下意识先打开的是 Agent,而不是某个应用。打开 Agent 之后,让 Agent 去帮我操作应用,我去验收或者调整 Agent 的操作结果。 这个变化看起来很小,但背后是一次入口的迁移。过去,应用是入口,人在应用里完成工作;现在,Agent 是入口,应用退到了后台,变成 Agent 调用的工具。 这种迁移一旦形成习惯,就很难逆转。就像人们从搜索引擎的首页开始上网,后来变成从微信和短视频开始,入口在哪,注意力就在哪,生态就在哪。 二、办公 Agent 已是红海,护城河可能在上下文 现在的 Agent,除了模型以外,Harness 这一层差距越来越小了,写文档、做表格、生成 PPT、操作浏览器,已经是各家基本功。模型可以换,工具可以接,功能差距会被迅速抹平。 真正的差距还得看 Agent 对组织了解多少,或者说能访问到哪些上下文数据,有最好的上下文,才有最好的企业级 Agent。 举个例子来说,我在《图解 Skill》举了个例子叫“周报 Skill”,如果你的 Agent 接不到任何工作数据,你就得把这周做了什么一条条告诉它,本质上你自己先写了一遍,它只是帮你润色。但如果 Agent 能读到你的会议纪要、你参与的群聊讨论、你编辑过的文档、你的项目看板,你只需要说一句“帮我写周报”,它就能基于你这一周真实做过的事,帮你生成一份有细节、有数据的工作总结。 所以,Agent 的通用能力容易被追平,但一个组织长期使用所沉淀下来的上下文:会议记录、文档资产、项目脉络、协作关系,这些才是别人复制不走的东西。谁拥有最完整的组织上下文,谁的 Agent 就能提供最精准的服务。从这个角度看,像飞书这样本身就是组织信息汇聚地的产品,天然就离这条护城河更近。 三、模型能力决定 Agent 能做多少事,权限决定组织敢让它做多少事 办公 Agent 和个人 Agent 有一个根本区别,很多人忽略了:权限。 个人场景下,你可以很随意。我自己就经常把 API Key 直接扔给 Agent 帮我验证代码,反正出了问题也只影响我自己。但在企业里,就不敢随便这么做了。 想想看,如果一个员工为了让 AI 帮忙写方案,顺手就把客户名单、合同内容、经营数据上传到了某个个人账号的 AI 工具,公司看不见他传了什么,不知道 AI 生成的内容又被转发给了谁,员工离职后这些数据还留在他的个人空间里。这不是假设,这是很多企业真实面对的情况,也是许多公司到今天还不敢放手让员工用 AI 的核心原因。 所以,企业级 Agent 必须解决一个前提问题:它得继承组织现有的权限体系。 员工看不到的数据,Agent 也看不到;未被授权的操作,Agent 也不能做。不是说限制 Agent 的能力,而是让组织敢把能力交给 Agent。 这一点上,那些本身就内建了完整权限和身份体系的协作平台有先天优势。Agent 接入之后,不需要重新搭一套安全架构,直接沿用组织已有的权限规则就行。 四、个人提效 ≠ 组织提效 这是我觉得最值得讨论的一点。现在每家公司都在推 AI,每个环节都有提效数字,但整体交付没快多少。核心原因是组织的流程还是围绕 AI Agent 之前组织架构搭建的,这些流程都是围绕人去设置的,有很多权限、审批都离不开人去做,但对 Agent 来说就会特别低效,Agent 只能在局部帮助提升效率,但是整体还是受制于人去确认审批。 真正的解法是围绕 Agent 重构流程:大部分确认环节交给 Agent 自验证,人只在关键路径上拍板。 但不是说这些确认环节都可以去掉,很多确认环节也都是有过很多教训之后才设立的,还是离不开人的判断,但有些流程是不是可以合并,是不是可以加速,还是值得仔细考虑的。 五、当 Agent 把很多执行的事情都做了怎么办? 这个问题很多人隐隐在担心,但换个角度看,Agent 把执行层的事做了:写文档、填数据、整理资料、跟进进度。并不是说人被替代了,而是人在往上走:更多精力要花在思考、决策和验收上。 过去,一个项目经理大量的时间花在整理信息、协调沟通、催进度上,真正用来思考“项目方向对不对、这个决策该怎么做”的时间都被挤占了。现在 Agent 把那些琐碎的事情接过去了,项目经理可以把精力放在更有价值地方,比如说:判断、取舍、创新。 回过头看,办公 Agent 的竞争,还得看谁能让 Agent 真正进入组织的工作现场:理解上下文、尊重权限、融入协作、推动流程,最终让人从执行中解放出来去做更有价值的事。 作为多年飞书用户,我一直很喜欢它在产品上的设计,那种想清楚了再做的克制感。这次豆包和飞书合并后,也是第一次看到两者真正融合的产物:「豆包工作」。意料之中,实际体验下来也没有让人失望。豆包的 Agent 能力加上飞书多年沉淀的组织关系、权限体系和协作数据,让人隐约看到了一种不一样的 Agent 形态:一种让 Agent 真正读懂组织、融入组织、为组织所用的形态。原推文媒体预览展开原推文收起原推文

@dotey

豆包今天发布了“豆包工作”,它和豆包桌面版应该是同一套程序和模型,但定位变了一个独立的办公 Agent 工作台。 豆包工作体验做的很好,有点像 Codex,能开项目、连接各种办公应用(尤其是飞书),体验后的一点感想: 一、用户的习惯正在发生变化,Agent 正在变成工作的入口 我发现自己处理工作时,下意识先打开的是 Agent,而不是某个应用。打开 Agent 之后,让 Agent 去帮我操作应用,我去验收或者调整 Agent 的操作结果。 这个变化看起来很小,但背后是一次入口的迁移。过去,应用是入口,人在应用里完成工作;现在,Agent 是入口,应用退到了后台,变成 Agent 调用的工具。 这种迁移一旦形成习惯,就很难逆转。就像人们从搜索引擎的首页开始上网,后来变成从微信和短视频开始,入口在哪,注意力就在哪,生态就在哪。 二、办公 Agent 已是红海,护城河可能在上下文 现在的 Agent,除了模型以外,Harness 这一层差距越来越小了,写文档、做表格、生成 PPT、操作浏览器,已经是各家基本功。模型可以换,工具可以接,功能差距会被迅速抹平。 真正的差距还得看 Agent 对组织了解多少,或者说能访问到哪些上下文数据,有最好的上下文,才有最好的企业级 Agent。 举个例子来说,我在《图解 Skill》举了个例子叫“周报 Skill”,如果你的 Agent 接不到任何工作数据,你就得把这周做了什么一条条告诉它,本质上你自己先写了一遍,它只是帮你润色。但如果 Agent 能读到你的会议纪要、你参与的群聊讨论、你编辑过的文档、你的项目看板,你只需要说一句“帮我写周报”,它就能基于你这一周真实做过的事,帮你生成一份有细节、有数据的工作总结。 所以,Agent 的通用能力容易被追平,但一个组织长期使用所沉淀下来的上下文:会议记录、文档资产、项目脉络、协作关系,这些才是别人复制不走的东西。谁拥有最完整的组织上下文,谁的 Agent 就能提供最精准的服务。从这个角度看,像飞书这样本身就是组织信息汇聚地的产品,天然就离这条护城河更近。 三、模型能力决定 Agent 能做多少事,权限决定组织敢让它做多少事 办公 Agent 和个人 Agent 有一个根本区别,很多人忽略了:权限。 个人场景下,你可以很随意。我自己就经常把 API Key 直接扔给 Agent 帮我验证代码,反正出了问题也只影响我自己。但在企业里,就不敢随便这么做了。 想想看,如果一个员工为了让 AI 帮忙写方案,顺手就把客户名单、合同内容、经营数据上传到了某个个人账号的 AI 工具,公司看不见他传了什么,不知道 AI 生成的内容又被转发给了谁,员工离职后这些数据还留在他的个人空间里。这不是假设,这是很多企业真实面对的情况,也是许多公司到今天还不敢放手让员工用 AI 的核心原因。 所以,企业级 Agent 必须解决一个前提问题:它得继承组织现有的权限体系。 员工看不到的数据,Agent 也看不到;未被授权的操作,Agent 也不能做。不是说限制 Agent 的能力,而是让组织敢把能力交给 Agent。 这一点上,那些本身就内建了完整权限和身份体系的协作平台有先天优势。Agent 接入之后,不需要重新搭一套安全架构,直接沿用组织已有的权限规则就行。 四、个人提效 ≠ 组织提效 这是我觉得最值得讨论的一点。现在每家公司都在推 AI,每个环节都有提效数字,但整体交付没快多少。核心原因是组织的流程还是围绕 AI Agent 之前组织架构搭建的,这些流程都是围绕人去设置的,有很多权限、审批都离不开人去做,但对 Agent 来说就会特别低效,Agent 只能在局部帮助提升效率,但是整体还是受制于人去确认审批。 真正的解法是围绕 Agent 重构流程:大部分确认环节交给 Agent 自验证,人只在关键路径上拍板。 但不是说这些确认环节都可以去掉,很多确认环节也都是有过很多教训之后才设立的,还是离不开人的判断,但有些流程是不是可以合并,是不是可以加速,还是值得仔细考虑的。 五、当 Agent 把很多执行的事情都做了怎么办? 这个问题很多人隐隐在担心,但换个角度看,Agent 把执行层的事做了:写文档、填数据、整理资料、跟进进度。并不是说人被替代了,而是人在往上走:更多精力要花在思考、决策和验收上。 过去,一个项目经理大量的时间花在整理信息、协调沟通、催进度上,真正用来思考“项目方向对不对、这个决策该怎么做”的时间都被挤占了。现在 Agent 把那些琐碎的事情接过去了,项目经理可以把精力放在更有价值地方,比如说:判断、取舍、创新。 回过头看,办公 Agent 的竞争,还得看谁能让 Agent 真正进入组织的工作现场:理解上下文、尊重权限、融入协作、推动流程,最终让人从执行中解放出来去做更有价值的事。 作为多年飞书用户,我一直很喜欢它在产品上的设计,那种想清楚了再做的克制感。这次豆包和飞书合并后,也是第一次看到两者真正融合的产物:「豆包工作」。意料之中,实际体验下来也没有让人失望。豆包的 Agent 能力加上飞书多年沉淀的组织关系、权限体系和协作数据,让人隐约看到了一种不一样的 Agent 形态:一种让 Agent 真正读懂组织、融入组织、为组织所用的形态。

背景
Agent Harness 是围绕大语言模型的软件基础设施,使其能够作为 AI Agent 运行,管理工具使用、记忆、状态和执行。在企业场景中,会议记录、文档和项目历史等上下文数据被视为护城河,因为它使 Agent 能够提供个性化和准确的服务。飞书是字节跳动的协作平台,汇聚了组织信息,因此天然适合企业 Agent 集成。办公 Agent 领域的竞争非常激烈,中国各大科技公司都推出了类似产品。

8月25日 13:57在 X 打开#AI Agent #Office Automation #Doubao #Product Analysis #Workplace Technology

028.0

以Qwen为首的中国开源大模型在研究引用中超越美国模型

对ChatGPT发布以来50万篇arXiv AI/ML论文的分析显示,以Qwen为代表的中国开源模型如今出现在约40%提及大模型的论文中,超过了美国开源模型的25%-30%。仅Qwen一家就被三分之一提及大模型的论文所引用,而Llama自2025年4月达到峰值后持续下滑。提及大模型的AI论文比例已从2023年的10%上升到2026年的50%以上。 这一转变表明中国开源模型已成为AI研究的默认基础,重塑了全球研究生态,并可能影响未来的模型开发与采用。它也凸显了中国AI实验室在开放科学领域日益增强的竞争力,有望加速创新并挑战美国模型的主导地位。 数据来自每日更新的Interconnects开放模型仪表盘,覆盖最热门的机器学习arXiv类别:cs.AI、cs.CL、cs.CV、cs.LG和stat.ML。OpenAI的闭源模型仍以约37%的提及率位居榜首,但Qwen以约33%紧随其后。DeepSeek在2025年1月发布R1后出现明显跃升,而Gemma和Mistral徘徊在5%-10%之间,完全开放的Olmo模型仍停留在约1%。

@Alibaba_Qwen引用推文2 张图片Open models, open science. Qwen keeps growing steadily, and we'll always be right here with the research community.🙌 Thanks for the deep dive! @natolambert原推文媒体预览+1展开原推文收起原推文

@Alibaba_Qwen

Open models, open science. Qwen keeps growing steadily, and we'll always be right here with the research community.🙌 Thanks for the deep dive! @natolambert

@natolambert

Over the weekend I had Codex parse 500K arXiv AI/ML papers since ChatGPT to understand which open models are used for research. In 2024, ~30% of papers mentioned an American open model and only 10% a Chinese model. Today, ~40% of papers mention a Chinese (open) LLM, and only 25-30% an American one. Chinese models are the default for research. Chinese mentions are still growing while American open models are stagnating. When looking at this data it's important to remember that papers substantially lag model releases, as research takes a long time. Qwen's steady growth is reflective of this, but so is Llama's lasting power. Some more observations: 1. Qwen has been steadily growing, and today 1/3 of papers which mention any LLM mention qwen. OpenAI's closed models are the highest overall, at ~37%. 2. Llama peaked around April of 2025 at 30% of papers which mention any LLM (including ChatGPT etc). Llama 4 was released at about the same time, and Llama has been declining since. 3. Gemini and Claude are less common than the leading open models, mentioned in 10-15% of papers puts them behind all of Qwen, Llama, and DeepSeek. Open models should be and are the foundations of open research. The % of papers mentioning any LLM have been steadily climbing since 2023. | Year | January | April | July | October | | 2023 | 10.43% | 15.39% | 18.69% | 32.18% | | 2024 | 29.70% | 33.93% | 35.70% | 44.25% | | 2025 | 39.23% | 45.28% | 44.94% | 53.52% | | 2026 | 55.49% | 57.26% | 53.14% | TBD Now over 50% of AI papers, from 10% in 2023. Other notes: - Gemma and Mistral hover around 5-10%. - Our beloved fully-open Olmo models have been ~1% since the first release in Jan. 2024. - DeepSeek has a clear jump after R1 in Jan. 2025 - Data derived from the most popular ML arXiv categories: cs. AI, cs. CL, cs. CV, cs. LG, stat. ML Just like our downloads and derivative model data, this is updated daily on the Interconnects Open Model Dashboard.

背景
Qwen是阿里巴巴云开发的大语言模型系列,于2023年4月首次推出,并于2023年9月开放公众使用。像Qwen和Llama这样的开源模型允许研究人员访问和修改模型权重,因此在学术研究中很受欢迎。arXiv是一个预印本服务器,大多数AI/ML论文都会发布在上面,分析论文引用可以洞察研究人员实际使用哪些模型。

8月25日 03:25在 X 打开#AI research #open models #Qwen #LLM adoption #arXiv analysis

038.0

Qwen3.8-27B 在 Code Arena WebDev 排名第9,是同级尺寸中唯一进入前十的模型

阿里巴巴的 Qwen3.8-27B 在 Code Arena WebDev 排行榜上以 1595 分位列总榜第9。它是同级尺寸(约270亿参数)中唯一进入前十的模型,并重塑了编码性能与模型尺寸之间的帕累托前沿。该模型仅比大得多的 Qwen3.8-Max 低6个名次,而4月发布的 Gemma 4-31B 仅排在第80位。 这一结果表明,一个相对较小的稠密模型能够在人类评估的编码基准上与更大的模型竞争,这对成本、延迟和部署效率具有重大意义。它挑战了只有超大模型才能提供顶级编码性能的假设,并可能加速在生产环境中采用更小、更高效的模型。重塑的帕累托前沿表明,Qwen3.8-27B 为开发者提供了性能与资源需求之间极具吸引力的平衡。 Qwen3.8-27B 是 Qwen3.8 系列中一个270亿参数的稠密模型,采用混合注意力骨干架构,并具备原生视觉语言能力。根据 vLLM 配方,它可以在 24.6 GiB 内存中提供服务,并支持在 1M 上下文长度下处理高达 660 万个 KV token。Code Arena WebDev 基准采用人在环评估,因此该排名比自动化指标更能反映实际编码的有用性。该模型 1595 分的成绩使其仅比大得多的 Qwen3.8-Max 低6个名次。

@Alibaba_Qwen引用推文1 张图片Qwen3.8-27B at #9 overall on Code Arena, the only model in its size class in the top 10.😎 Small but mighty. Thanks for the recognition! @arena原推文媒体预览展开原推文收起原推文

@Alibaba_Qwen

Qwen3.8-27B at #9 overall on Code Arena, the only model in its size class in the top 10.😎 Small but mighty. Thanks for the recognition! @arena

@arena

Exciting news: Qwen3.8-27B by @Alibaba_Qwen just landed in Code Arena: WebDev at #9 overall with 1595 pts. It is the only model in its size class in the top 10, and also reshapes the Pareto Frontier! It is only 6 ranks behind the much larger Qwen3.8-Max. For scale: Gemma 4-31B which was released back in April sits at #80. Congrats to @Alibaba_Qwen on the release! See thread for more highlights on Qwen3.8-27B.

背景
Code Arena WebDev 是一个人在环的 AI 编码基准,用户提交提示词并对模型输出进行投票,从而产生类似 Elo 的排名。AI 模型中的帕累托前沿代表了在性能和成本(或尺寸)之间提供最佳权衡的模型集合;重塑前沿的模型在其尺寸下提供了比以往模型更好的性能。Qwen 是阿里巴巴的大语言模型系列,以开放权重发布和在各种基准上的强劲表现而闻名。Qwen3.8 系列包括不同尺寸的模型,从较小的稠密模型到像 Qwen3.8-Max 这样的大型混合专家(MoE)模型。

8月25日 03:24在 X 打开#AI #LLM #Qwen #Code Arena #model performance

048.0

39家顶级科技公司300多篇工程博客文章精选清单

一个GitHub仓库整理了来自Airbnb、Netflix、Uber、Stripe、Figma、Discord等39家顶级公司的300多篇高质量工程博客文章。这些文章按公司分类,每篇都标注了主题标签和发表年份。主题涵盖搜索、支付、架构、数据工程、性能、数据库和基础设施。 这个精选合集汇集了行业领先公司的一手生产经验,为工程师节省了大量搜索时间。它对系统设计面试准备尤其有价值,因为理解真实世界的架构权衡至关重要。该资源还通过提供来自在规模上解决过类似问题的公司的可比案例,帮助进行架构决策。 该仓库位于github.com/ashishps1/awesome-engineering-articles。它包含来自39家公司的文章,每篇都带有主题和年份标签,便于快速浏览。内容源自真实生产经验,而非二手总结。未提供许可、维护状态或更新频率信息。

@GitHub_Daily原推文2 张图片这份清单把 300 多篇高质量工程博客收在一起,来自 Airbnb、Netflix、Uber、Stripe、Figma、Discord 等 39 家顶级公司。 按公司分好类,每篇标了主题标签和发表年份,扫一眼就知道值不值得点进去查看。 GitHub:http://github.com/ashishps1/awesome-engineering-articles 主题涵盖搜索、支付、架构、数据工程、性能、数据库和基础设施,都是从线上跑出来的经验。 准备系统设计面试的时候翻一翻,比看二手总结扎实得多,手上正要做架构选型也能拿来找同类案例。原推文媒体预览+1展开原推文收起原推文

@GitHub_Daily

这份清单把 300 多篇高质量工程博客收在一起,来自 Airbnb、Netflix、Uber、Stripe、Figma、Discord 等 39 家顶级公司。 按公司分好类,每篇标了主题标签和发表年份,扫一眼就知道值不值得点进去查看。 GitHub:http://github.com/ashishps1/awesome-engineering-articles 主题涵盖搜索、支付、架构、数据工程、性能、数据库和基础设施,都是从线上跑出来的经验。 准备系统设计面试的时候翻一翻,比看二手总结扎实得多,手上正要做架构选型也能拿来找同类案例。

背景
大型科技公司的工程博客通常包含教科书上没有的详细事后分析、架构深入探讨和性能调优见解。像这样的精选列表聚合了此类内容,使其易于发现。系统设计面试经常要求候选人设计可扩展系统,研究真实案例是一种常见的准备策略。

8月25日 07:30在 X 打开#engineering-blogs #system-design #curated-list #architecture #resources

058.0

OpenAI 公布与 Cerebras 合作定制推理芯片 Jalapeño 的强劲成果

OpenAI 公布了其首款定制推理芯片 Jalapeño 的出色性能成果,该芯片与 Cerebras 合作开发。该芯片已从概念阶段进入实验室真实工作负载测试,在单一架构中同时实现了更高的吞吐量和更低的延迟,且不牺牲效率。团队强调,由 Cerebras 硬件支持的 /ultrafast 服务需求旺盛。 这标志着 OpenAI 在硬件领域的重大里程碑,减少了对 Nvidia GPU 的依赖,并有望在提升速度的同时降低推理成本。它可能加速 OpenAI 最强大模型向高要求客户的部署,并加剧 AI 推理芯片市场的竞争。 独立测试显示,Jalapeño 在吞吐量和能效方面优于 Nvidia 的 Blackwell 芯片和 Google 的 TPU。该芯片与 Broadcom 合作设计,仅用九个月完成,对于新芯片而言时间异常短。Cerebras 的晶圆级引擎(WSE-3)集成了 4 万亿晶体管和 90 万个 AI 核心,推理速度比 GPU 快达 30 倍。

@thsottiaux串推 2 条2 段 · 1 个视频Excited about our Jalapeno results today. An incredible achievement from the team, taking a new chip from concept all the way to very impressive performance on real workloads in the lab. Tomorrow’s fast will feel like today’s ultrafast. As I’ve mentioned before, we’re pushing to bring this to as many people as possible. We’ve seen a TON of demand for /ultrafast, made possible by our deep partnership with Cerebras and their unique hardware, which will push the frontiers of tomorrow's ultrafast even further. I’m very much looking forward for the collaboration to continue pushing the absolute limits of how fast we can run our most capable models on Cerebras and bring this to the most demanding customers. > 引用 @OpenAI: Since announcing Jalapeño, our first custom inference chip, we’ve been testing it and the system around it. > > The results show a major advance: more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without sacrificing efficiency.原推文媒体预览展开原推文收起原推文

@thsottiaux串推 2 条

Excited about our Jalapeno results today. An incredible achievement from the team, taking a new chip from concept all the way to very impressive performance on real workloads in the lab. Tomorrow’s fast will feel like today’s ultrafast. As I’ve mentioned before, we’re pushing to bring this to as many people as possible. We’ve seen a TON of demand for /ultrafast, made possible by our deep partnership with Cerebras and their unique hardware, which will push the frontiers of tomorrow's ultrafast even further. I’m very much looking forward for the collaboration to continue pushing the absolute limits of how fast we can run our most capable models on Cerebras and bring this to the most demanding customers. > 引用 @OpenAI: Since announcing Jalapeño, our first custom inference chip, we’ve been testing it and the system around it. > > The results show a major advance: more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without sacrificing efficiency.

@OpenAI

Since announcing Jalapeño, our first custom inference chip, we’ve been testing it and the system around it. The results show a major advance: more intelligence from every watt and faster responses, delivering both higher throughput and lower latency in one architecture without sacrificing efficiency.

@cerebras ftw!

背景
AI 推理芯片是为高效运行已训练 AI 模型而设计的专用硬件,重点关注速度和能耗。Cerebras Systems 以其晶圆级引擎闻名,该处理器使用整片硅晶圆而非较小的芯片,提供大规模并行计算能力。OpenAI 历来依赖 Nvidia GPU 进行推理,但一直在开发定制芯片以降低成本并提升性能。

8月25日 18:01在 X 打开#AI hardware #OpenAI #Cerebras #inference #chip

067.0

Apodex 1.1:开源AI Agent框架与35B模型,主打深度研究

一位开发者分享了Apodex 1.1的实测体验,该AI代理不仅能整理资料生成报告,还能端到端执行任务。配套的Agent执行框架FrontierAgent已开源,无需Docker,一条命令即可运行。团队还开源了Apodex 1.1 mini(35B)模型,官方评测显示其在专业、金融、科研等基准上达到前沿系统水平。 这一进展降低了构建深度研究代理的门槛:开发者可以本地部署35B模型,配合FrontierAgent搭建自己的系统。该框架基于插件的架构和开源特性可能加速其在AI代理生态中的采用。它也标志着从被动研究工具向主动执行任务的代理的转变。 FrontierAgent提供原生命令行TUI、ReAct和Agent Team模式,可在macOS和Linux上运行,无需预安装或强制Docker依赖。Apodex 1.1 mini是35B模型,已在Hugging Face上发布。Web界面显示任务看板和子代理,并允许用户在任务中途补充信息;交付前会进行116项数据、内容和来源查证。开发者总结认为DeepSeek Harness迭代迅速,正式接入应再等等,但个人可以先行体验。

@GitHub_Daily原推文4 张图片自从 DeepSeek Harness 开源之后,我便一直在纠结要不要将其接入到自己的产品当中。 于是想调研一下,被我发现了一款非常好用的 AI 产品:Apodex 1.1。 地址:https://www.apodex.ai 与传统 Deep Research 工具有所不同,它不光整理资料出报告,还会动手执行任务,一路干到交付。 其配套的 Agent 执行框架 FrontierAgent 是开源的,无需安装 Docker,一条命令即可运行。 GitHub:https://github.com/ApodexAI/FrontierAgent 他们还开源了 Apodex 1.1 mini(35B)模型,官方评测里,专业、金融、科研几项都能摸到前沿系统同一档的水平。 模型权重:https://huggingface.co/collections/apodex/apodex-11 正想做 Deep Research 产品的朋友,可以本地部署 mini 模型,套上 FrontierAgent 就能自己搭一个。 这次调研,我是直接在它的 Web 端上实测的,效果出乎意料的好。 在发送需求后,它立马拆分任务,创建不同角色的子 Agent,并分配任务开始执行。(如图 1) 右侧显示的任务看板全程可见,每个任务做到哪一步、哪个 Agent 在干活都清清楚楚。 最实用的是,它在执行任务过程中,我们还能随时给它补充信息或者需求。(如图 2) 我补充要求它与其他工具进行横向对比,并调研一下现在 dsh-plugin 插件生态如何。 还留意到在交付报告前,它还会进行数据、内容、来源等 116 项查证,给人增加不少信任。(如图 3) 最后完整的结论(如图 4),一句话总结:目前 DeepSeek Harness 迭代速度非常快,正式接入建议再等等,个人可以先装着玩玩。原推文媒体预览+3展开原推文收起原推文

@GitHub_Daily

自从 DeepSeek Harness 开源之后,我便一直在纠结要不要将其接入到自己的产品当中。 于是想调研一下,被我发现了一款非常好用的 AI 产品:Apodex 1.1。 地址:https://www.apodex.ai 与传统 Deep Research 工具有所不同,它不光整理资料出报告,还会动手执行任务,一路干到交付。 其配套的 Agent 执行框架 FrontierAgent 是开源的,无需安装 Docker,一条命令即可运行。 GitHub:https://github.com/ApodexAI/FrontierAgent 他们还开源了 Apodex 1.1 mini(35B)模型,官方评测里,专业、金融、科研几项都能摸到前沿系统同一档的水平。 模型权重:https://huggingface.co/collections/apodex/apodex-11 正想做 Deep Research 产品的朋友,可以本地部署 mini 模型,套上 FrontierAgent 就能自己搭一个。 这次调研,我是直接在它的 Web 端上实测的,效果出乎意料的好。 在发送需求后,它立马拆分任务,创建不同角色的子 Agent,并分配任务开始执行。(如图 1) 右侧显示的任务看板全程可见,每个任务做到哪一步、哪个 Agent 在干活都清清楚楚。 最实用的是,它在执行任务过程中,我们还能随时给它补充信息或者需求。(如图 2) 我补充要求它与其他工具进行横向对比,并调研一下现在 dsh-plugin 插件生态如何。 还留意到在交付报告前,它还会进行数据、内容、来源等 116 项查证,给人增加不少信任。(如图 3) 最后完整的结论(如图 4),一句话总结:目前 DeepSeek Harness 迭代速度非常快,正式接入建议再等等,个人可以先装着玩玩。

背景
传统的深度研究工具通常只收集信息并生成报告,而Apodex 1.1增加了任务执行能力,即可以采取行动来完成目标。FrontierAgent是支撑这一行为的开源框架,支持ReAct(推理与行动)和多代理团队模式。DeepSeek Harness是DeepSeek AI推出的另一个开源代理框架,采用插件架构,模型、工具和沙箱都是插件。该开发者正在评估是否将DeepSeek Harness集成到自己的产品中,并以Apodex作为对比。

8月25日 13:30在 X 打开#AI agents #open-source #deep research #LLM #product review

077.0

微软 AI Engineer Coach 分析本地 AI 编码日志,识别反模式

微软发布了 AI Engineer Coach,这是一个开源的 VS Code 扩展,可读取 Claude Code 和 Copilot 等编码助手生成的本地 AI 会话日志。它提供一个保护隐私的仪表盘,内置 45 条反模式规则,涵盖提示词质量、会话卫生、代码审查、工具熟练度和上下文管理。该工具还生成使用统计、周趋势、每日活跃度图表,并建议将频繁重复的提示词转化为可复用的技能。 该工具解决了使用 AI 编码助手的开发人员的一个常见痛点:缺乏关于其提示词和工作流习惯的客观反馈。通过分析本地日志且不将数据发送到设备之外,它提供了一种切实可行的方法来提高 AI 辅助编码的效率和代码质量。它也反映了软件行业中衡量和优化人机协作的更广泛趋势。 该扩展在 MIT 许可证下开源,必须手动构建和安装,因为它尚未在 VS Code 市场上架。它还可以在 GitHub Copilot 应用程序中作为画布运行。该工具通过检查项目指令文件是否完整以及代理是否能够实际访问预期的上下文来对“上下文健康度”进行评分。它按语言、项目、模型和工具对 AI 生成的代码进行分类,提供细粒度的统计信息。

@GitHub_Daily原推文1 张图片天天用 Claude Code 和 Copilot 写代码,哪些习惯在拖后腿,光凭感觉其实说不清。 微软开源的 AI Engineer Coach 读本地的会话日志,把这段过程做成一个仪表盘,数据不出本机。 内置 45 条反模式规则,提示词质量、会话卫生、代码审查、工具熟练度、上下文管理,逐条给检查结果。 GitHub:http://github.com/microsoft/AI-Engineering-Coach 产出也统计,AI 生成的代码按语言、项目、模型和工具分开算量,周趋势和每日活跃度都有图。 有个功能是把重复敲过很多次的提示词挑出来,建议做成可复用的 Skill,这个思路我觉得挺实在。 上下文健康度会单独打分,看项目里的指令文件写得全不全,哪些地方 Agent 其实读不到东西。 目前没上应用市场,得自己拉下来打包成插件再装进 VS Code,也能在 GitHub Copilot 应用里当画布跑。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

天天用 Claude Code 和 Copilot 写代码,哪些习惯在拖后腿,光凭感觉其实说不清。 微软开源的 AI Engineer Coach 读本地的会话日志,把这段过程做成一个仪表盘,数据不出本机。 内置 45 条反模式规则,提示词质量、会话卫生、代码审查、工具熟练度、上下文管理,逐条给检查结果。 GitHub:http://github.com/microsoft/AI-Engineering-Coach 产出也统计,AI 生成的代码按语言、项目、模型和工具分开算量,周趋势和每日活跃度都有图。 有个功能是把重复敲过很多次的提示词挑出来,建议做成可复用的 Skill,这个思路我觉得挺实在。 上下文健康度会单独打分,看项目里的指令文件写得全不全,哪些地方 Agent 其实读不到东西。 目前没上应用市场,得自己拉下来打包成插件再装进 VS Code,也能在 GitHub Copilot 应用里当画布跑。

背景
像 GitHub Copilot 和 Claude Code 这样的 AI 编码助手会生成本地会话日志,记录提示词、工具调用和代码更改。这些日志通常未被充分利用,但包含有关开发人员行为的丰富数据。反模式是常见的低效做法,例如模糊的提示词或糟糕的上下文管理,会降低 AI 生成代码的质量。可复用技能是预定义的指令集,可以调用它们为 AI 代理提供跨会话的一致程序性知识。

8月25日 04:00在 X 打开#AI coding #developer tools #Microsoft #Claude Code #Copilot

087.0

OpenAI 推出 100 美元的 ChatGPT Business 高级席位

OpenAI 推出了 ChatGPT Business 高级席位,这是一个专为小型团队和初创企业设计的每席位 100 美元的新方案。它包含所有 ChatGPT、ChatGPT Work 和 Codex 功能,以及 SAML SSO、MFA、集中计费和使用分析等企业级能力。该方案取消了 5 小时使用限制,并提供比标准席位多五倍的使用量。 此举将企业级 AI 功能普及到小型企业,此前这些企业需要购买更昂贵的企业方案。通过以更低的价格提供高级安全和管理功能,它可能加速初创公司和精简团队对 AI 的采用。该定价也使 OpenAI 在面向中小企业市场的竞争中更具优势。 高级席位适用于 ChatGPT Business 工作区,并可根据需要分配给不同用户。该方案包含与 Google Workspace、Slack、GitHub 和 Microsoft 365 的集成。据 OpenAI 称,高级席位提供比标准席位多五倍的使用量,并取消了五小时使用限制。定价为每个席位每月 100 美元,详见 ChatGPT 定价页面。

@thsottiaux引用推文1 个视频So much demand for this one. Works similar to the Pro $100 plan but designed for teams and small companies. ✅ All ChatGPT, ChatGPT Work, and Codex features ✅ Connect to Google Workspace, Slack, GitHub, Microsoft 365, and more ✅ Secure workspace with SAML, SSO, and MFA ✅ Centralized billing and administration ✅ Usage analytics and spend controls ✅ No 5h limits原推文媒体预览展开原推文收起原推文

@thsottiaux

So much demand for this one. Works similar to the Pro $100 plan but designed for teams and small companies. ✅ All ChatGPT, ChatGPT Work, and Codex features ✅ Connect to Google Workspace, Slack, GitHub, Microsoft 365, and more ✅ Secure workspace with SAML, SSO, and MFA ✅ Centralized billing and administration ✅ Usage analytics and spend controls ✅ No 5h limits

@OpenAI

Introducing ChatGPT Business Premium Seats The new $100 Premium seat is a game changer for small businesses and startups—giving lean teams better tools, faster workflows, and capabilities once reserved for big companies. A flexible plan that scales with your team’s ambition. https://chatgpt.com/pricing/?type=team

背景
ChatGPT Business 是 OpenAI 面向组织推出的付费方案,提供管理控制、安全功能和集中计费。标准席位此前有五小时使用限制,高级席位现已取消该限制。SAML SSO 和 MFA 是常见的企业身份验证方法,可增强安全性并简化用户管理。新的高级席位层级旨在弥合个人 Pro 方案与完整企业产品之间的差距。

8月25日 20:16在 X 打开#OpenAI #ChatGPT #Business #AI #Pricing

097.0

OpenAI 将恢复 ChatGPT Plus 的 5 小时使用限制

OpenAI 宣布从明天起,将恢复 ChatGPT Plus 账户在 ChatGPT Work 和 Codex 上的 5 小时使用限制。该限制在最近几周曾被临时取消,只保留了每周上限。未来几个月内,每月 100 美元和 200 美元的 Pro 订阅用户将不受影响。 这一变化直接影响到依赖长时间会话进行编码和工作任务的 ChatGPT Plus 用户,可能会打乱他们的工作流程。它反映了 OpenAI 在用户需求增长的情况下,平衡计算能力与需求的持续挑战。豁免 Pro 层级的决定凸显了分层服务策略,即付费更高的用户获得更稳定的访问权限。 5 小时限制专门适用于 ChatGPT Work 和 Codex,并非所有 ChatGPT 功能。OpenAI 表示,该限制有助于平滑计算负载,并防止轻度用户意外耗尽每周用量。该限制此前曾被推迟,现在因运营需要而恢复。未来几个月内,每月 100 美元和 200 美元的 Pro 订阅明确不在此限制范围内。

@thsottiaux原推文Tomorrow we will bring back the 5h limit for Plus accounts across ChatGPT Work and Codex. I had mentioned this a while ago, but then postponed it. This is necessary as (a) the 5h limit allows us to smoothen the load on our compute, allowing to keep the plan generous in terms of weekly usage and (b) users on the Plus plan are relatively casual and new users, but then also just accidentally eat through their whole weeks usage and then are confused, making it not a great experience. We are for the upcoming months keeping the 5h limit not enabled for Pro $100 and Pro $200 subscriptions.展开原推文收起原推文

@thsottiaux

Tomorrow we will bring back the 5h limit for Plus accounts across ChatGPT Work and Codex. I had mentioned this a while ago, but then postponed it. This is necessary as (a) the 5h limit allows us to smoothen the load on our compute, allowing to keep the plan generous in terms of weekly usage and (b) users on the Plus plan are relatively casual and new users, but then also just accidentally eat through their whole weeks usage and then are confused, making it not a great experience. We are for the upcoming months keeping the 5h limit not enabled for Pro $100 and Pro $200 subscriptions.

背景
ChatGPT Plus 是一种付费订阅层级,与免费版本相比,提供更广泛的模型和工具访问权限。基于时间或消息数量的使用限制在 AI 服务中很常见,用于管理服务器负载并确保公平访问。OpenAI 会根据基础设施容量和用户行为定期调整这些限制。5 小时限制此前曾实施,后来被临时取消,现在正在恢复。

8月25日 01:16在 X 打开#OpenAI #ChatGPT #policy change #usage limits #AI services

107.0

Anthropic 将让 Claude Code 更易定制,支持 Agents.MD

Anthropic 员工 trq212 宣布 Claude Code 即将迎来增强,使其更易于定制,包括能够轻松使用 Agents.MD 以及进行其他系统提示修改。该公告发布在 X(推特)上,是对用户反馈的回应,并承诺在功能准备就绪时分享更多细节。目前,用户已经可以在 Claude.MD 中引用 @Agents.MD 作为临时解决方案。 这一变化解决了开发者希望为不同模型或工作流定制 Claude Code 行为时遇到的常见痛点。通过让系统提示更易访问并支持开放的 Agents.MD 格式,Anthropic 顺应了智能体互操作性和开发者控制权的生态趋势。这可能会带来更好的性能,并使编码智能体在不同项目中的行为更加一致。 Anthropic 的理由是模型系列不可互换,系统提示会显著影响性能。Claude Code 目前为每个模型使用不同的系统提示,团队承认维护这些提示需要大量工作。即将到来的可定制性改进将允许用户轻松使用 Agents.MD 或进行其他系统提示修改。短期内,用户可以在 Claude.MD 文件中引用 @Agents.MD。

@trq212引用推文excited to share more on how we’re making Claude Code more hackable soon展开原推文收起原推文

@trq212

excited to share more on how we’re making Claude Code more hackable soon

@trq212

Hi Tobi, thanks for the feedback! We are working on making Claude Code more hackable, which will include being able to easily use Agents.MD or make other system prompt modifications. I’ll share more here when it’s ready to roll out. Our reasoning for this was that we don't think that model families are interchangeable and the system prompt can have a big impact on performance. I wrote here: https://x.com/trq212/status/2080710971228918066 on how Claude models like their skills, system prompt, Claude.MD, etc to be formatted. In Claude Code we have different system prompts per model. That said, I know this is a lot of upkeep and not worth the squeeze for everyone. Feedback heard and I'll keep you posted. In the immediate term, you can always @Agents.MD from your Claude.MD.

背景
Claude Code 是 Anthropic 的智能编码工具,在终端和 IDE 中运行,旨在理解代码库并协助开发者。Agents.MD(也写作 AGENTS.md)是一种为编码智能体提供指令的开放格式,已被超过 60,000 个开源项目使用。系统提示是提供给语言模型的初始指令,用于定义其行为和能力。Claude Code 目前为不同模型使用不同的系统提示,用户一直要求对这些提示拥有更多控制权。

8月25日 17:30在 X 打开#Claude Code #Anthropic #AI tools #developer experience #system prompts

117.0

LangChain:将任务规范与实现分离,打造可复用的编码智能体

LangChain 分享了 Vtrivedy10 和 Nick Hollon 撰写的一篇文章,主张在编码智能体中将任务设计与实现分离。该方法引入“世界规范”(world spec),用于捕获智能体学到的知识,使其能在未来任务中复用。这标志着重点从一次性代码生成转向构建持久、可适应的智能体知识。 该方法解决了当前编码智能体的一个核心局限:它们往往孤立地处理每个任务,丢失宝贵的上下文。通过外部化“世界规范”,智能体可以积累关于代码库和领域的知识,提高跨任务的效率和一致性。这与规范驱动开发和智能体工程的更广泛趋势一致,有望减少开发者的重复工作。 该文章由 LangChain 官方 X 账号分享,表明这一主要 AI 框架提供商对其表示认可或至少进行了放大传播。“世界规范”概念尚未成为标准化工具,而是一种提议的模式;推文中未提供基准测试或定量结果。作者为 Vtrivedy10 和 Nick Hollon,但摘要中未包含他们的所属机构及文章完整技术细节。该方法仍处于概念阶段,需要在真实编码智能体工作流中进一步验证。

@LangChain引用推文.@Vtrivedy10 + @nickhollon10 on why you should separate deciding what a task should look like from building it, and how to let a coding agent turn what it learns into a reusable "world spec" for every future task. A closer look ⤵️展开原推文收起原推文

@LangChain

.@Vtrivedy10 + @nickhollon10 on why you should separate deciding what a task should look like from building it, and how to let a coding agent turn what it learns into a reusable "world spec" for every future task. A closer look ⤵️

背景
编码智能体是能够根据自然语言指令编写、调试和重构代码的 AI 系统。LangChain 是一个流行的框架,用于构建基于大语言模型的应用程序,包括基于智能体的系统。规范驱动开发是一种新兴实践,开发者编写详细规范来指导 AI 编码工具,例如 GitHub Spec Kit 等工具。“世界规范”概念对此进行了扩展,让智能体自身维护一个可复用的环境模型,而不仅仅依赖人类编写的规范。

8月25日 15:06在 X 打开#AI agents #coding agents #LangChain #software engineering #LLM

127.0

评估需要区分力来分辨有实质差异的AI系统

这篇帖子解释了好的评估必须具有区分力,即能够区分有实质差异的AI系统。它举了一个例子:五个系统的得分在92到95之间,但评估未能揭示A和C实际上远优于D和E。作者将此比作给博士生做五年级数学测试:人人都得满分,你无法了解谁更聪明。 这一见解很重要,因为许多团队依赖的评估要么太简单要么太难,导致盲目自信或白费力气。没有区分力,评估就无法指导模型选择、提示工程或迭代改进。该帖子指出了AI评估中常见的失败模式,并指出了实用的最佳平衡点:现实、有难度且对能力差异敏感。 示例分数为A:94,B:93,C:95,D:94,E:92,但该评估无法区分已知的质量差距(A、C与D、E之间)。作者警告不要随意提高评估难度,否则所有人都不及格,评估就不再衡量预期能力。最佳平衡点被描述为“现实+有难度+对能力差异敏感”。帖子最后问读者,当好的评估随时间饱和时该怎么办。

@realmadhuguru引用推文How to build great evals - part 8. The discriminatory property of evals. A hill-climbing eval is useful when it can separate AI systems that are meaningfully different. Imagine you run an eval on five AI systems: A: 94 B: 93 C: 95 D: 94 E: 92 Now suppose you already know A and C are substantially better systems than D and E. The eval is bad cos it doesn’t tell you that. It has low discriminatory power. It’s like giving a fifth-grade math test to a group of PhDs - everyone aces it and you’ve learned nothing about who is the smartest. That doesn’t mean making evals arbitrarily hard. Then everyone fails and you’re not measuring what your systems are meant for. The sweet spot for an eval is: Realistic + difficult + sensitive to differences in capability. Over time, your good evals will saturate as your harness and underlying models improve. What do you do then? Drop your guesses in the comments. Share this with your teammates.展开原推文收起原推文

@realmadhuguru

How to build great evals - part 8. The discriminatory property of evals. A hill-climbing eval is useful when it can separate AI systems that are meaningfully different. Imagine you run an eval on five AI systems: A: 94 B: 93 C: 95 D: 94 E: 92 Now suppose you already know A and C are substantially better systems than D and E. The eval is bad cos it doesn’t tell you that. It has low discriminatory power. It’s like giving a fifth-grade math test to a group of PhDs - everyone aces it and you’ve learned nothing about who is the smartest. That doesn’t mean making evals arbitrarily hard. Then everyone fails and you’re not measuring what your systems are meant for. The sweet spot for an eval is: Realistic + difficult + sensitive to differences in capability. Over time, your good evals will saturate as your harness and underlying models improve. What do you do then? Drop your guesses in the comments. Share this with your teammates.

@realmadhuguru

How to build great evals - part 7. The Goldilocks principle for eval construction. Your evals should measure at the level of the various jobs to be done, not just the final answer. E.g. consider a financial analysis agent. It's ultimate output is a stock recommendation. The most common mistake I see is teams create a golden set of right answers and check if the agent recommended the "right” stock. The problem here is that there are probably a bunch of meaningful jobs that happened before this recommendation. E.g. 1/ Understanding the client: their portfolio, risk tolerance, investment horizon, goals, constraints 2/ Gather evidence: latest data points on the different stock stocks, the sectors, macro environment, Fed policy, recent and upcoming news events 3/ Analyze the data: revenue growth, valuation guidance, growth projections and produce a narrower number of candidate stocks 4/ Make a recommendation: stock ticker name, bid/sell price, timeframe Each of these is a stage and produces an intermittent output. Each of them can (and maybe should have) their own eval so you can diagnose issues. If the final recommendation is wrong, a well designed eval set would tell you: Client understanding : 92%, Evidence extraction : 92%, Data analysis: 70% Recommendation: 75% Now you know where to go dig. And you might go, man the data analysis step is too complex and I need to break it down into a set of jobs to be done, and construct eval sets for them. Not too granular. Not too coarse. Just right. Make your eval set as granular as you need to diagnose and act. Drop your eval questions in the comments and I will answer in future posts. Share this with your teammates! See you tomorrow.

背景
在AI开发中,“评估”是一组用于衡量模型性能的任务或基准。“爬山”指的是开发者调整提示词或模型,并用评估来检查改动是否提高分数的迭代过程。区分力是测量理论中的一个概念:好的测试应该对真实能力不同的对象给出不同的分数。用五年级数学测试给博士生做的类比说明了天花板效应,即测试太简单,无法揭示高水平者之间的差异。

8月25日 01:15在 X 打开#AI evaluation #machine learning #evals #model benchmarking