7月20日2026 · 星期一

从 18 条抓取中筛选 12 条 · twitter × 5 账号 · 02:51 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. Kimi K3 在 ValsAI 的 Vibe Code Bench 上以 85.0% 排名第二8.0
  2. 模型公司FDE阳谋:捕获企业知识,取代软件工程师8.0
  3. OpenMOSS 发布 MOSS-Transcribe-Diarize-0.9B 端到端多人语音转录模型8.0
  4. 泄露基准测试显示 Qwen3.8 比肩 Claude Opus 4.8,即将开源8.0
  5. OpenHack:开源智能体安全扫描工具,全程本地运行8.0
  6. 对唯参数论模型评价的批判:Kimi K3 与 Fable 5 的用户体验对比7.0
  7. Claude Code 团队揭示 /loop、/goal、工作流及系统提示缩减 80%7.0
  8. ACE-Step Studio:免费离线AI音乐生成工具发布7.0
  9. lazyssh:一款从 SSH config 浏览和连接服务器的终端 SSH 管理器7.0
  10. RetroAssembly:带现代功能的浏览器复古游戏模拟器7.0
  11. 更聪明的模型需要更少指导:精简系统提示以提升性能7.0
  12. Kimi K3需求激增,暂停新订阅7.0
018.0

Kimi K3 在 ValsAI 的 Vibe Code Bench 上以 85.0% 排名第二

月之暗面推出的 Kimi K3 是一个 2.8 万亿参数的开源模型,在 ValsAI 的 Vibe Code Bench 上以 85.0% 的得分排名第二。该基准测试评估模型根据自然语言提示从零开始构建完整网页应用的能力。这一成绩凸显了 Kimi K3 强大的自主编程能力。 这一排名表明,中国的开源模型在实际软件工程任务中正变得与顶尖闭源系统不相上下。它预示着 AI 能够自主处理端到端开发,可能加速原型设计并降低非编程人员的门槛。这一结果可能影响企业采用率和对大规模开源模型的进一步投资。 Kimi K3 拥有 2.8 万亿参数、100 万 token 的上下文窗口,并采用 Kimi Delta Attention(KDA)混合线性注意力机制。Vibe Code Bench 包含 100 个真实的网页应用规格,分为公开验证集和私有测试集。Kimi K3 的 85.0% 得分使其仅次于第一名,但推文中未透露领先模型的身份。该模型可通过 API 使用,定价为每百万输入 token 3 美元,每百万输出 token 15 美元。

@Kimi_Moonshot 转推了

@ValsAI

Kimi K3 is the #2 overall model on our in-house Vibe Code Bench at 85.0%. VCB tests a model's ability to go from zero-to-one; creating a web application completely from scratch.

背景
Vibe Code Bench 是 Vals AI 创建的基准测试,用于检验 AI 模型能否根据自然语言描述生成完整、可部署的网页应用。它专注于“从零到一”的创建,即模型必须在没有人工干预的情况下生成所有必要的代码。Kimi K3 是由北京初创公司月之暗面开发的多模态推理模型,该公司获得阿里巴巴投资。该模型以其庞大的规模和开源发布而引人注目,是公开可用的最大模型之一。这类基准测试对于衡量 AI 驱动软件开发领域的进展至关重要,该领域是各大 AI 实验室激烈竞争的焦点。

7月19日 04:10在 X 打开#AI #LLM #coding #benchmark #Kimi

028.0

模型公司FDE阳谋:捕获企业知识,取代软件工程师

模型公司正在部署现场交付工程师(FDE)帮助企业落地AI智能体,在销售Token的同时系统性地将领域知识沉淀为可复用的技能(Skills)。这些技能随后被内化到模型中,减少了对人类工程师的需求,若业务未随之拓展,可能导致裁员。 这一策略标志着范式转变:AI公司直接将企业知识货币化,将其转化为不断增值的资产。它威胁到传统的软件工程师岗位,但也为懂AI的工程师创造了暂时的生存空间,凸显了AI驱动效率提升的双重性。 FDE模式由Palantir首创,将工程师嵌入客户组织以定制解决方案并将洞察反馈至产品开发。引用的推文强调构建“飞轮”:将每个项目的沟通、需求、交付方案和结果结构化,形成知识库和评估标准,使AI智能体能生成基础方案并持续改进。这一过程将组织能力转化为超越个体员工的系统。

@dotey引用推文FDE 就是模型公司的阳谋:先让人去帮企业落地 Agent 卖 Token,把企业知识沉淀成 Skills,然后把这些 Skills 内化到模型。 接下来企业就不需要那么多人了,如果因为效率提升带来了业务的拓展,那皆大欢喜,如果业务并没有拓展,那就只有财源广进降本增效了。 未来各行各业都要被 AI 卷了,懂 AI 的软件工程师反而因为 FDE 还能苟延残喘一段。 AI 能力越强竟然越来越有些悲观,虽然未来是美好的,但转型过程中是残酷的。展开原推文收起原推文

@dotey

FDE 就是模型公司的阳谋:先让人去帮企业落地 Agent 卖 Token,把企业知识沉淀成 Skills,然后把这些 Skills 内化到模型。 接下来企业就不需要那么多人了,如果因为效率提升带来了业务的拓展,那皆大欢喜,如果业务并没有拓展,那就只有财源广进降本增效了。 未来各行各业都要被 AI 卷了,懂 AI 的软件工程师反而因为 FDE 还能苟延残喘一段。 AI 能力越强竟然越来越有些悲观,虽然未来是美好的,但转型过程中是残酷的。

@bozhou_ai

最近我聊了很多正在做FDE的伙伴,我感觉现在做 FDE,最值得做的一件事,就是让每个项目都给下一个项目打工。 把每轮客户沟通、需求判断、交付方案、修改原因和最终结果,全部沉淀成结构化资料。 案例足够多以后,把它们做成 Agent 的知识库、Skills 和评估标准。 新客户第一次沟通结束,Agent 先产出一版基础方案;团队负责校准判断、处理例外,再把新经验回流进去。 这套飞轮一旦转起来,公司最重要的资产就不再是某个明星员工,而是一套不断复利的交付系统。 它的价值不是让人变成 Agent 的执行者,而是让每个普通成员,都能调用团队里最优秀那个人的经验和判断。 人会流动,但组织能力不会跟着一起清零

背景
现场交付工程师(FDE)是在客户现场工作以实施和定制软件的技术人员,该模式由Palantir推广。在AI领域,FDE帮助企业采用AI智能体,即执行任务的自主程序。“技能”指封装的领域知识或流程,可供AI智能体执行。内化意味着将这些技能直接嵌入AI模型,减少对外部提示或人工干预的依赖。这一趋势反映了行业向利用企业数据学习以自动化复杂工作流的AI系统的广泛转变。
社区讨论
讨论强化了原帖观点,通过一个详细示例说明将项目产物结构化为知识库可创建自我改进的交付系统。评论者一致认为,这种方法将组织知识转化为持久资产,减少对个人才能的依赖,使普通团队成员也能高水平发挥。

7月19日 15:47在 X 打开#AI Agents #Enterprise AI #FDE #Knowledge Capture #Job Displacement

038.0

OpenMOSS 发布 MOSS-Transcribe-Diarize-0.9B 端到端多人语音转录模型

OpenMOSS 开源了 MOSS-Transcribe-Diarize-0.9B,一个 0.9B 参数的端到端模型,可一次性完成长音频转录、说话人分离和精确时间戳标注。它能在单张 RTX 4090 上单次处理最长 90 分钟的音频,实时率仅为 0.017。该模型将语音识别、说话人标注和时间对齐统一为一个自回归任务,无需额外的说话人分离或对齐模型。 该模型简化了传统的多阶段会议转录流程,使高质量、带说话人标注的转写更易获取且更高效。它降低了计算开销和集成复杂度,有利于开发会议助手、字幕工具和语音分析应用。其 Apache 2.0 开源协议允许商用,有望降低相比云端方案的成本。 架构采用 Whisper-Medium 编码器与 Qwen3-0.6B 风格解码器,支持 128K 上下文和 50 多种语言。模型不支持标点符号,自定义提示和热词可能未生效。转录速度比 Qwen3-ASR-0.6B 慢,但可直接输出带说话人标签的片段,无需 Pyannote 或 WeSpeaker。更强的“Pro”版本将通过 API 提供。

@dotey串推 2 条2 段 · 3 张图片今天给 BaoCut 集成了 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B,能够一次性将长音频转换为结构化、带说话人标注的转写结果。 它有点好就是不需要专门的发言人识别模型,直接输出带精确时间戳、发言人的时间对齐文本。 转录速度比 qwen3-asr-0.6b 要慢些,不支持标点符号,似乎自定义 Prompt 与热词没有起作用。 项目地址:https://github.com/OpenMOSS/MOSS-Transcribe-Diarize/blob/main/README_zh.md > 引用 @dotey: 最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: > > 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效果,需要人工去从头到尾校对一遍 > > 一个问题是中英文混排支持不好,中文其实支持也不算太好,所以中文的转录就效果很差 > > 一个问题是不直接支持识别发言人 > > 虽然这些问题都可以通过收费的云端模型来解决,但是成本相对高一些。 > > 最近测试了 Qwen3 ASR,效果是真的很不错,配合 Qwen3-ForcedAligner 模型,可以识别后把词级时间戳对的很精准。0.6b 就足够了,本地运行资源占用也不高。https://github.com/QwenLM/Qwen3-ASR > > 发言人识别也有开源的模型:Pyannote + WeSpeaker。不过这个发言人一多尤其是一起说话识别的不够准,但配合 Agent 结合上下文就能做到相对比较准了。 > > 如果真的要求高,也可以走云端模型,比如火山引擎上的豆包录音文件识别模型 2.0 就质量挺好,速度也快,就是要额外花钱。原推文媒体预览+2展开原推文收起原推文

@dotey串推 2 条

今天给 BaoCut 集成了 OpenMOSS 开源的 MOSS-Transcribe-Diarize-0.9B,能够一次性将长音频转换为结构化、带说话人标注的转写结果。 它有点好就是不需要专门的发言人识别模型,直接输出带精确时间戳、发言人的时间对齐文本。 转录速度比 qwen3-asr-0.6b 要慢些,不支持标点符号,似乎自定义 Prompt 与热词没有起作用。 项目地址:https://github.com/OpenMOSS/MOSS-Transcribe-Diarize/blob/main/README_zh.md > 引用 @dotey: 最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: > > 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效果,需要人工去从头到尾校对一遍 > > 一个问题是中英文混排支持不好,中文其实支持也不算太好,所以中文的转录就效果很差 > > 一个问题是不直接支持识别发言人 > > 虽然这些问题都可以通过收费的云端模型来解决,但是成本相对高一些。 > > 最近测试了 Qwen3 ASR,效果是真的很不错,配合 Qwen3-ForcedAligner 模型,可以识别后把词级时间戳对的很精准。0.6b 就足够了,本地运行资源占用也不高。https://github.com/QwenLM/Qwen3-ASR > > 发言人识别也有开源的模型:Pyannote + WeSpeaker。不过这个发言人一多尤其是一起说话识别的不够准,但配合 Agent 结合上下文就能做到相对比较准了。 > > 如果真的要求高,也可以走云端模型,比如火山引擎上的豆包录音文件识别模型 2.0 就质量挺好,速度也快,就是要额外花钱。

@dotey

最早我做字幕翻译的时候,语音转文字是用的 Whisper,但是 Whisper 有几个问题: 一个问题是时间戳不准,时间戳不准拆分的就是就可能字幕和语音对不上,很影响效果,需要人工去从头到尾校对一遍 一个问题是中英文混排支持不好,中文其实支持也不算太好,所以中文的转录就效果很差 一个问题是不直接支持识别发言人 虽然这些问题都可以通过收费的云端模型来解决,但是成本相对高一些。 最近测试了 Qwen3 ASR,效果是真的很不错,配合 Qwen3-ForcedAligner 模型,可以识别后把词级时间戳对的很精准。0.6b 就足够了,本地运行资源占用也不高。https://github.com/QwenLM/Qwen3-ASR 发言人识别也有开源的模型:Pyannote + WeSpeaker。不过这个发言人一多尤其是一起说话识别的不够准,但配合 Agent 结合上下文就能做到相对比较准了。 如果真的要求高,也可以走云端模型,比如火山引擎上的豆包录音文件识别模型 2.0 就质量挺好,速度也快,就是要额外花钱。

OpenMOSS 开源 MOSS-Transcribe-Diarize-0.9B,多人长音频转写一次搞定「说了什么、谁说的、何时说的」。 0.9B 参数,128K 上下文,最长约 90 分钟音频一次喂进去,不切片不拼接。 4090 单卡,RTF 0.017,5–10 分钟录音 30 秒转完。 架构是 Whisper-Medium 编码器 + Qwen3-0.6B 风格 decoder,端到端一个自回归任务全包,不走 ASR+说话人分离+时间对齐那套级联。 带热词增强,人名/术语/型号能预配。 Apache 2.0,能商用。 模型 🤗 http://huggingface.co/OpenMOSS-Team/MOSS-Transcribe-Diarize 代码 http://github.com/OpenMOSS/MOSS-Transcribe-Diarize

背景
传统的带说话人标注的转录通常需要级联多个独立模型:语音识别(ASR)获取文本,说话人分离(如 Pyannote、WeSpeaker)标注谁在何时说话,以及强制对齐(如 Qwen3-ForcedAligner)优化时间戳。MOSS-Transcribe-Diarize 将这些步骤合并为一个模型,降低了延迟和复杂度。Qwen3-ASR 是近期轻量级 ASR 模型,配合其强制对齐器可获得精准时间戳。Whisper 是流行的 ASR 模型,但在时间戳准确性和说话人识别方面存在不足。
社区讨论
开发者 @dotey 指出,虽然该模型便于端到端带说话人标注的转录,但速度比 Qwen3-ASR 慢,不支持标点,且热词/提示功能可能未生效。他们此前使用 Whisper 发现时间戳不准、中英混排支持差,并测试了 Qwen3-ASR 配合强制对齐获得更好效果。对于高要求场景,推荐使用豆包等云端服务,尽管成本较高。

7月19日 06:48在 X 打开#ASR #speaker diarization #open-source #AI #audio processing

048.0

泄露基准测试显示 Qwen3.8 比肩 Claude Opus 4.8,即将开源

阿里巴巴 Qwen3.8 的内部基准测试结果泄露,显示其净胜率比上一代 Qwen3.7-Max 提升了 22.8%。该模型超越了 KIMI-K3 和 GLM-5.2,与 Claude Opus 4.8 几乎持平,仅落后 1.8 个百分点。预览版已在 Token Plan、Qoder 和 QoderWork 上线。 这些结果使 Qwen3.8 成为顶级开源权重模型,直接与 Claude Opus 4.8 等闭源巨头竞争。其强大的编码和智能体能力可能加速在企业工作流和开发者工具中的应用。计划中的开源发布或将进一步普及前沿 AI 性能。 Qwen3.8 是一个 2.4 万亿参数模型,预览版在全栈开发、多智能体编排和长时间任务中表现出色。它仅在 Fable-5-Xhigh 面前明显落后,后者被认为是最强的闭源代码模型之一。预览版定价为 10 单位(货币未指定),可通过阿里巴巴平台访问。

@Pluvio9yte引用推文2 张图片Qwen3.8的内部测评结果泄露了: 对上一代自家的 Qwen3.7-Max 提升巨大(+22.8% 净胜率)。 已经超过 KIMI-K3 和 GLM-5.2。 和 Claude Opus 4.8 基本打平(只差 1.8 个百分点)。 唯一明显落后的只有 Fable-5-Xhigh(可能是当前 Coding 最强闭源模型之一)。 让我来试一下真假🧐原推文媒体预览+1展开原推文收起原推文

@Pluvio9yte

Qwen3.8的内部测评结果泄露了: 对上一代自家的 Qwen3.7-Max 提升巨大(+22.8% 净胜率)。 已经超过 KIMI-K3 和 GLM-5.2。 和 Claude Opus 4.8 基本打平(只差 1.8 个百分点)。 唯一明显落后的只有 Fable-5-Xhigh(可能是当前 Coding 最强闭源模型之一)。 让我来试一下真假🧐

@Pluvio9yte

Kimi K3 刚发布,Qwen3.8-Max-Preview 今天就上线了??? 阿里千问今天官宣:Qwen3.8(2.4T 参数)即将发布并开源权重,同时Qwen3.8-Max-Preview 预览版已经首发上线 Token Plan、Qoder 和 QoderWork。 这波比 Kimi K3 晚了不到三天,但节奏拉得非常紧。 相比上一个版本 Qwen3.7-Max,我看了一下社区已经发布的帖子,这次 Preview 主要在以下几个真实场景有明显升级: 全栈开发 & 复杂工程任务:从前端原型到多文件大型项目,内部测评反馈更稳、更能持续执行。 多 Agent 编排 + 长程任务:Office 工作流、数据分析这类需要多个 Agent 协作的长时间任务,一致性据说又上了一个台阶。之前我看案例已经有 3.7-Max 已经能跑 35 小时+ 的自主内核优化,这次应该更不会差 Coding Plan:能直接嵌入到 Qoder 这类 coding 平台里,帮你处理日常开发 + 办公流。 先蹲一下benchmark测试数据吧,有信心放出来感觉效果应该不会差😄

背景
Qwen 是阿里巴巴的大语言模型系列,Qwen3.7-Max 是上一代旗舰。Claude Opus 4.8 是 Anthropic 最新的高端模型,以编码和智能体任务见长。Fable-5-Xhigh 是 Anthropic 的 Claude Fable 5 的一个努力级别,针对复杂编码优化。KIMI-K3 和 GLM-5.2 是竞品中国 AI 模型。开源权重模型允许用户访问和修改模型参数,促进社区创新。

7月19日 17:03在 X 打开#AI #LLM #Qwen #benchmark #model release

058.0

OpenHack:开源智能体安全扫描工具,全程本地运行

OpenHack 是一款新发布的开源智能体安全扫描工具,全程使用开源模型在本地运行。它执行侦察、狩猎、验证和复核四个阶段,甚至会在 Docker 沙箱中发起真实攻击来验证漏洞。该工具为每个发现的问题提供严重程度、代码片段和修复建议。 该工具解决了开发者的两大痛点:商业安全扫描工具的高昂费用和将代码上传到云端的隐私风险。通过使用开源模型在本地运行,OpenHack 使持续安全扫描变得经济且私密,有望为小团队和个人开发者普及高级漏洞检测能力。 OpenHack 使用四阶段流水线:侦察、狩猎、验证和复核。它包含沙箱模式,在 Docker 容器内执行真实的漏洞利用尝试以确认漏洞。该工具开源并托管在 GitHub 上,可通过命令行安装。它仅使用开源模型,确保不依赖专有服务。

@GitHub_Daily原推文1 张图片想给项目做一次安全扫描,使用商业工具收费很贵,再者把代码传到云端,不太放心。 OpenHack 是个开源的 Agentic 安全扫描工具,扫描全程只用开源模型,源码本地处理。 工具有侦察、狩猎、验证、复核四道流程,找到的每个漏洞都会给出严重程度、位置、代码片段和修复建议。 GitHub:http://github.com/openhackai/OpenHack 还带沙箱和浏览器复核模式,真的会在 Docker 容器里发起攻击验证漏洞是否能被利用。 适合想自查项目安全又不想把代码交出去的开发者,命令行装上就能跑。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

想给项目做一次安全扫描,使用商业工具收费很贵,再者把代码传到云端,不太放心。 OpenHack 是个开源的 Agentic 安全扫描工具,扫描全程只用开源模型,源码本地处理。 工具有侦察、狩猎、验证、复核四道流程,找到的每个漏洞都会给出严重程度、位置、代码片段和修复建议。 GitHub:http://github.com/openhackai/OpenHack 还带沙箱和浏览器复核模式,真的会在 Docker 容器里发起攻击验证漏洞是否能被利用。 适合想自查项目安全又不想把代码交出去的开发者,命令行装上就能跑。

背景
传统的安全扫描通常依赖商业工具,这些工具收费高昂且需要将代码上传到云端服务器,引发隐私担忧。智能体安全扫描器使用 AI 智能体自主探索和测试代码库,模拟人类安全研究人员。开源模型是公开可用的 AI 模型,可以在本地运行,避免数据泄露。Docker 容器提供隔离环境,用于安全执行可能有危害的代码。

7月19日 07:30在 X 打开#security #open-source #devtools #privacy #AI

067.0

对唯参数论模型评价的批判:Kimi K3 与 Fable 5 的用户体验对比

X 上的一篇技术讨论反对唯参数论,对比了 Kimi K3 与 Claude Fable 5。作者认为 Kimi K3 的单次生成能力很强,但在长上下文中的性能衰减更早出现;而 Fable 5 全面的长尾数据训练保证了持续稳定的性能,在多步骤任务中的成功率显著更高。 该分析凸显了 AI 模型评价从原始基准测试向真实用户体验的转变,尤其是在非程序员用户涌入市场的背景下。它强调了模型设计选择(如优先单次成功还是长上下文可靠性)如何影响用户满意度和采用率,以及情感设计原则在感知模型质量中的作用。 Kimi K3 是一个 2.8 万亿参数模型,拥有 100 万 token 上下文窗口,但在上下文长度 40-50% 时性能衰减明显。Fable 5 是 Anthropic 的 Mythos 级模型,在上下文长度 80-90% 时才出现急剧性能衰减。作者计算,将每步失败概率减半可使 50 步任务成功率提升近 4 倍。讨论还指出,Kimi K3 的单次生成优势吸引了 2026 年的非程序员办公人群,而专业开发者更看重长上下文可靠性。

@realWeZZard@dotey 转推我不认同,这是典型的唯参数论。忽略了模型厂商的战略眼光、模型训练对用户体验的供给以及模型使用人口变迁。 Kimi K3 标注是 Opus 4.8 级别,我个人体验下来其实是基于它的木桶短板标的,而它的长板完全可及 Fable 5。Kimi K3 在长尾数据的训练上面并没有 Fable 5 训练得那么全,会导致在多轮对话的任务中失败一次,然后次次修补,进入一个很差的体验。这和 Opus 4.8 的体验完全一致。 而 2026 年中的顶规模型可以保证状态一直在线。首先 Fable 5 的长尾数据训练非常全面。然后 Fable 5 的急剧性能衰减需要到达上下文长度的 80% 到 90% 才会出现。而 Kimi K3 基本在 40-50% 时就能感受到性能衰减。 上述 Fable 5 的优势对于整体体验来说提升的不只是一点两点,而是四五倍的提升——因为每一步有 5% 的任务失败概率,那么 10 步都成功的概率仅为 60%;而把每一步的失败概率消除一半,那么 10 步都成功的概率将提升至 78%。这个提升对于长程任务来说只会更夸张,比如放大到 50 步则可以将成功率提升接近 4 倍。 这就是 Fable 5 对于从事从 0 到 1 创新的工作者来说体验非常棒的原因——因为从 0 到 1 不可能 one-shot、也极有可能进入数据训练盲区。 那为什么大家会觉得 Kimi K3 好?是因为它的 one-shot 能力真的很强。而 one shot 成功自然会带来成就感。 而早在移动互联网开始时,很多人争相阅读的 Emotional Design 中就强调过「成就感」对用户体验带来的提升。Frog Design 的创始人 Hartmut Esslinger 也提出过 "Forms follow emotion(形式追随情绪)" 的设计原则。 所谓「形式追随情绪」就是让情绪成为恰到好处的功能装置。而大部分用户想用最快的速度搞点东西出来,那极高的 one shot 成功率带来的极高情绪满足就是最好的功能装置。 但 one shot 很多 AI IDE 在 2025 年就能做到,为什么 2025 年它的传播效应没有这么高,而 2026 年可以? 这是因为用户人群发生了改变。在 2025 年的主要适用人群——专业开发者看来,one-shot 能力是非常鸡肋的,因为我们要对工程细节进行打磨。但是 2026 年更多非程序员群体以办公人群的身份加入,导致评价标准发生了变化。 就像在移动互联网时代我们不能说:对于普通人来说想处理照片 Lightroom 足够了,没有必要购入 Photoshop。因为对于普通人来说真正合适的是美图秀秀、醒图、各种风格化相机。 可以说月之暗面在模型训练方面押注前端 one-shot 能力确实是一手好棋。 当然,这些用户会成长,会想做一些个性化的改动、会有创造新东西的需求。最后还是会碰到长 K3 上下文性能衰减和长尾数据不全面的短板。不过我想国产开源大模型应该已经有了第一批国内原住民——这些人没有用过美国头部两家的模型,在他们眼里,Kimi 就是最好的。展开原推文收起原推文

@dotey 转推了

@realWeZZard

我不认同,这是典型的唯参数论。忽略了模型厂商的战略眼光、模型训练对用户体验的供给以及模型使用人口变迁。 Kimi K3 标注是 Opus 4.8 级别,我个人体验下来其实是基于它的木桶短板标的,而它的长板完全可及 Fable 5。Kimi K3 在长尾数据的训练上面并没有 Fable 5 训练得那么全,会导致在多轮对话的任务中失败一次,然后次次修补,进入一个很差的体验。这和 Opus 4.8 的体验完全一致。 而 2026 年中的顶规模型可以保证状态一直在线。首先 Fable 5 的长尾数据训练非常全面。然后 Fable 5 的急剧性能衰减需要到达上下文长度的 80% 到 90% 才会出现。而 Kimi K3 基本在 40-50% 时就能感受到性能衰减。 上述 Fable 5 的优势对于整体体验来说提升的不只是一点两点,而是四五倍的提升——因为每一步有 5% 的任务失败概率,那么 10 步都成功的概率仅为 60%;而把每一步的失败概率消除一半,那么 10 步都成功的概率将提升至 78%。这个提升对于长程任务来说只会更夸张,比如放大到 50 步则可以将成功率提升接近 4 倍。 这就是 Fable 5 对于从事从 0 到 1 创新的工作者来说体验非常棒的原因——因为从 0 到 1 不可能 one-shot、也极有可能进入数据训练盲区。 那为什么大家会觉得 Kimi K3 好?是因为它的 one-shot 能力真的很强。而 one shot 成功自然会带来成就感。 而早在移动互联网开始时,很多人争相阅读的 Emotional Design 中就强调过「成就感」对用户体验带来的提升。Frog Design 的创始人 Hartmut Esslinger 也提出过 "Forms follow emotion(形式追随情绪)" 的设计原则。 所谓「形式追随情绪」就是让情绪成为恰到好处的功能装置。而大部分用户想用最快的速度搞点东西出来,那极高的 one shot 成功率带来的极高情绪满足就是最好的功能装置。 但 one shot 很多 AI IDE 在 2025 年就能做到,为什么 2025 年它的传播效应没有这么高,而 2026 年可以? 这是因为用户人群发生了改变。在 2025 年的主要适用人群——专业开发者看来,one-shot 能力是非常鸡肋的,因为我们要对工程细节进行打磨。但是 2026 年更多非程序员群体以办公人群的身份加入,导致评价标准发生了变化。 就像在移动互联网时代我们不能说:对于普通人来说想处理照片 Lightroom 足够了,没有必要购入 Photoshop。因为对于普通人来说真正合适的是美图秀秀、醒图、各种风格化相机。 可以说月之暗面在模型训练方面押注前端 one-shot 能力确实是一手好棋。 当然,这些用户会成长,会想做一些个性化的改动、会有创造新东西的需求。最后还是会碰到长 K3 上下文性能衰减和长尾数据不全面的短板。不过我想国产开源大模型应该已经有了第一批国内原住民——这些人没有用过美国头部两家的模型,在他们眼里,Kimi 就是最好的。

@Fenng

其实大多数用户,对他们那点简单的需求而言,给他们一个中等水平的模型已经足够用了,也就是市场上随便哪个几乎都足够用。如果你宣传某个模型有十万亿参数,评测绝对第一,超级无敌。那他们用起来之后,就会真心觉得这模型真的超级超级厉害,用起来心情愉快,还会不停发文狂吹乱夸。 这就是 𝕏 上 AI 相关内容的现状。

背景
Kimi K3 是中国初创公司月之暗面开发的大语言模型,定位为面向长程编程和知识工作的前沿模型。Claude Fable 5 是 Anthropic 的模型,专为安全通用用途设计,具有强大的长上下文性能。“单次生成”指模型在首次尝试时即生成正确输出的能力。“长尾数据”指罕见或边缘案例,对模型在多样化真实场景中的稳健性能至关重要。情感设计是一种用户体验概念,强调产品应唤起积极情绪以提升用户满意度。
社区讨论
讨论中引用了一条评论,认为大多数用户对中等水平模型已感满意,参数数量和基准测试的炒作驱动了用户感知。原作者表示同意,但补充说用户人群正在变化,使得单次生成能力更受非程序员群体重视。

7月19日 18:43在 X 打开#AI models #model evaluation #user experience #LLM comparison #technical analysis

077.0

Claude Code 团队揭示 /loop、/goal、工作流及系统提示缩减 80%

Claude Code 团队的 Thariq 解释了 /loop、/goal 和工作流如何支持长时间运行的自主代理。他还透露 Claude Code 的系统提示已缩减 80%,因为新模型需要的指导更少。现场演示展示了使用 Claude Code 编辑发布视频。 这些功能使 AI 代理在长时间的软件工程任务中更实用,减少了人工监督。系统提示的大幅缩减标志着向更精简、能力更强的模型转变,这些模型需要更少的约束。这影响了寻求高效、自主编码助手的开发者。 /loop 以设定的间隔重复提示,用于轮询或检查;/goal 让代理自主工作直到满足条件,最好与自动模式配合使用。工作流将这些组合用于复杂的多步骤任务。系统提示的缩减得益于 Claude 4 Fable 5 模型推理能力的提升。

@petergyang@trq212 转推1 个视频“We’ve got /loop, /goal, and workflows. They all get the agent to run for long periods of time.” Here’s my new episode with @trq212 from the Claude Code team, where he shared how he plans, builds, and runs loops with Claude Code: → How /loop, /goal, and workflows work differently → Live demo: Editing launch videos with Claude → Using HTML artifacts to plan and learn Some quotes from Thariq: “We cut Claude Code’s system prompt by 80%. As models have gotten smarter, they need less direction, fewer constraints, and fewer examples.” “Planning is an iterative process of exploring, investigating, and finding out what you don’t know.” “One failure mode I see is that people glaze over AI’s plans. You want to make sure it’s something you read.” I've been wanting to interview Thariq for a long time and I learned so much from this epsiode. 📌 Watch now: https://youtu.be/aVO6E181cNU Thanks to our sponsors: @RiversidedotFM: All-in-one AI studio for podcasts and video https://creators.riverside.com/PeterYang @WisprFlow: 4x faster than typing with your voice https://ref.wisprflow.ai/peteryang原推文媒体预览展开原推文收起原推文

@trq212 转推了

@petergyang

“We’ve got /loop, /goal, and workflows. They all get the agent to run for long periods of time.” Here’s my new episode with @trq212 from the Claude Code team, where he shared how he plans, builds, and runs loops with Claude Code: → How /loop, /goal, and workflows work differently → Live demo: Editing launch videos with Claude → Using HTML artifacts to plan and learn Some quotes from Thariq: “We cut Claude Code’s system prompt by 80%. As models have gotten smarter, they need less direction, fewer constraints, and fewer examples.” “Planning is an iterative process of exploring, investigating, and finding out what you don’t know.” “One failure mode I see is that people glaze over AI’s plans. You want to make sure it’s something you read.” I've been wanting to interview Thariq for a long time and I learned so much from this epsiode. 📌 Watch now: https://youtu.be/aVO6E181cNU Thanks to our sponsors: @RiversidedotFM: All-in-one AI studio for podcasts and video https://creators.riverside.com/PeterYang @WisprFlow: 4x faster than typing with your voice https://ref.wisprflow.ai/peteryang

背景
Claude Code 是 Anthropic 推出的一款终端内 AI 编码助手。系统提示是指导 AI 行为的指令;如果模型足够智能,减少系统提示可以提高性能。/loop、/goal 和工作流是允许代理长时间自主运行而无需持续用户输入的命令。

7月19日 17:23在 X 打开#Claude Code #AI agents #workflows #system prompt optimization #software engineering

087.0

ACE-Step Studio:免费离线AI音乐生成工具发布

ACE-Step Studio 是一款新发布的开源AI音乐生成工具,完全在本地Nvidia GPU上离线运行。它能够生成最长8分钟、带人声的完整歌曲,支持翻唱改编和局部重绘,并包含AI歌词生成功能。该工具无需订阅或API密钥即可免费使用,且会自动安装适配显卡的优化版本。 该工具为Suno等基于订阅的AI音乐服务提供了免费、无限制的替代方案,消除了成本障碍和云端依赖。它使音乐人、爱好者和研究人员能够在本地进行AI音乐生成实验,促进创作并保护隐私。其开源特性也有助于社区贡献和定制化开发。 ACE-Step Studio 需要至少12GB显存的Nvidia GPU(若不使用offload则推荐20GB)。它采用本地DiT模型和语言模型进行音乐生成,并可选配云端服务以提升质量。该工具包含视频工作室,可制作MV和卡拉OK字幕,并提供一键安装流程。

@GitHub_Daily原推文1 张图片用 Suno 这类 AI 音乐工具生成歌曲要订阅,免费额度有限,想放开了多试几次得掏钱。 ACE-Step Studio 是个本地跑的 AI 音乐生成工作室,主打离线运行,不用订阅不限次数。 能生成带人声的完整歌曲,最长 8 分钟,还支持翻唱改编、局部重绘、AI 自动写歌词。 GitHub:http://github.com/timoncool/ACE-Step-Studio 配了视频工作室,能给歌曲配上 MV 和卡拉 OK 字幕,一键装好,会自动匹配对应显卡的版本。 需要 12GB 以上显存的 N 卡,适合想免费折腾 AI 音乐、又不想把创作丢云端的朋友。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

用 Suno 这类 AI 音乐工具生成歌曲要订阅,免费额度有限,想放开了多试几次得掏钱。 ACE-Step Studio 是个本地跑的 AI 音乐生成工作室,主打离线运行,不用订阅不限次数。 能生成带人声的完整歌曲,最长 8 分钟,还支持翻唱改编、局部重绘、AI 自动写歌词。 GitHub:http://github.com/timoncool/ACE-Step-Studio 配了视频工作室,能给歌曲配上 MV 和卡拉 OK 字幕,一键装好,会自动匹配对应显卡的版本。 需要 12GB 以上显存的 N 卡,适合想免费折腾 AI 音乐、又不想把创作丢云端的朋友。

背景
像Suno这样的AI音乐生成工具允许用户通过文本提示创作歌曲,但通常需要付费订阅才能大量使用。ACE-Step Studio基于ACE-Step 1.5模型构建,这是一个强大的本地音乐生成系统。它利用扩散Transformer(DiT)架构和语言模型来生成带人声的连贯音乐。本地运行确保了隐私并避免重复费用,但需要较高的GPU资源。

7月19日 13:30在 X 打开#AI music #open source #offline #generative AI #GitHub

097.0

lazyssh:一款从 SSH config 浏览和连接服务器的终端 SSH 管理器

lazyssh 是一款新的终端 SSH 管理器,它能读取本地 SSH config 文件,并以可搜索的交互式列表展示所有服务器。它支持按别名、IP 或标签进行模糊搜索,一键连接,置顶常用服务器,并能在界面内直接编辑端口转发、跳板主机等高级选项。该工具在修改 SSH config 前会自动备份。 管理大量服务器常导致 SSH config 文件臃肿,难以记住并快速连接特定主机。lazyssh 通过提供快速的键盘驱动界面,简化了服务器访问和配置,为开发者和运维工程师节省时间。其模糊搜索和置顶功能减少了日常工作流中的摩擦,提升了多服务器环境下的效率。 lazyssh 受 lazydocker 和 k9s 等工具启发,专为 SSH 主机管理而构建。它读取标准的 ~/.ssh/config 文件,并允许交互式地添加、编辑、置顶、ping 和删除条目。该工具支持本地与远程机器之间的文件传输,并在任何修改前自动备份 SSH config。它是开源的,可在 GitHub 仓库 Adembc/lazyssh 获取。

@GitHub_Daily原推文1 张图片手头服务器一多,SSH config 文件越写越长,想连哪台都得翻半天记录才想起地址。 lazyssh 是个终端里的 SSH 管理器,读取本地 SSH config,把所有服务器列成一份可以搜索的清单。 支持按别名、IP、标签模糊搜索,回车直接连上,常用的服务器还能置顶。 GitHub:http://github.com/Adembc/lazyssh 改动 SSH config 前会自动备份,端口转发、代理跳板、密钥这些进阶配置也能在界面里直接改。 适合手上管着一堆服务器、懒得每次翻配置文件的运维和开发者。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

手头服务器一多,SSH config 文件越写越长,想连哪台都得翻半天记录才想起地址。 lazyssh 是个终端里的 SSH 管理器,读取本地 SSH config,把所有服务器列成一份可以搜索的清单。 支持按别名、IP、标签模糊搜索,回车直接连上,常用的服务器还能置顶。 GitHub:http://github.com/Adembc/lazyssh 改动 SSH config 前会自动备份,端口转发、代理跳板、密钥这些进阶配置也能在界面里直接改。 适合手上管着一堆服务器、懒得每次翻配置文件的运维和开发者。

背景
SSH(安全外壳协议)是用于安全连接远程服务器的协议,SSH config 文件(~/.ssh/config)存储了不同服务器的主机名、用户名和密钥等连接设置。随着管理的服务器数量增加,该文件可能变得冗长且难以浏览。模糊搜索是一种查找近似匹配的技术,允许用户使用部分或拼写错误的查询进行搜索。像 lazyssh 这样的终端用户界面(TUI)提供了键盘驱动的交互方式,以提高速度和效率,常用于开发者工具。

7月19日 10:00在 X 打开#SSH #DevOps #Tool #Productivity #Server Management

107.0

RetroAssembly:带现代功能的浏览器复古游戏模拟器

RetroAssembly 是一个新的网页端模拟器,将 NES、SNES、Genesis、GameBoy 和街机等经典游戏机直接搬进浏览器,省去了复杂的配置过程。它能自动为上传的 ROM 匹配封面图,实时同步存档,并为部分模拟器提供倒带功能。该平台开源,并可通过 Docker 自托管。 该工具通过省去手动配置模拟器的麻烦,让玩家在任何有浏览器的设备上都能访问游戏库,大大降低了重温老游戏的门槛。云存档同步和倒带功能提升了游戏体验,对怀旧玩家和新手都很有吸引力。其开源性质和 Docker 支持也满足了注重隐私和喜欢自托管的用户需求。 RetroAssembly 支持键盘、手柄和屏幕虚拟摇杆操作,因此可在移动设备上畅玩。用户需自行上传合法获取的 ROM 文件,平台不提供受版权保护的游戏。官方托管版本可在 retroassembly.com 使用,源代码托管在 GitHub 的 arianrhodsandlot/retroassembly 仓库中。

@GitHub_Daily原推文1 张图片小时候玩的红白机、世嘉游戏,想找回来重温一下,光是配置各种模拟器就得折腾半天。 RetroAssembly 把这些老游戏机搬进了浏览器,NES、SNES、Genesis、GameBoy、街机全都支持,打开网页就能玩。 自动给游戏库配上封面和 box art,存档能实时同步,玩砸了还能用部分模拟器直接回放重来。 GitHub:http://github.com/arianrhodsandlot/retroassembly 支持键盘或手柄做空间导航,没手柄的话用屏幕虚拟摇杆也能玩,出门在外也能续上进度。 官方托管版本直接用,也能用 Docker 自己搭一份私有的,想重温童年游戏的朋友可以玩下。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

小时候玩的红白机、世嘉游戏,想找回来重温一下,光是配置各种模拟器就得折腾半天。 RetroAssembly 把这些老游戏机搬进了浏览器,NES、SNES、Genesis、GameBoy、街机全都支持,打开网页就能玩。 自动给游戏库配上封面和 box art,存档能实时同步,玩砸了还能用部分模拟器直接回放重来。 GitHub:http://github.com/arianrhodsandlot/retroassembly 支持键盘或手柄做空间导航,没手柄的话用屏幕虚拟摇杆也能玩,出门在外也能续上进度。 官方托管版本直接用,也能用 Docker 自己搭一份私有的,想重温童年游戏的朋友可以玩下。

背景
复古游戏模拟器通过软件模拟旧游戏机的硬件,让经典游戏在现代设备上运行。传统上,配置模拟器需要下载不同程序、设置 BIOS 文件并管理 ROM,对普通用户来说颇为繁琐。基于浏览器的模拟利用 WebAssembly 等技术直接在网页中运行模拟器核心,简化了访问流程。RetroAssembly 在此基础上提供了统一的界面,具备游戏库管理和云功能,类似于商业服务但可自托管。

7月19日 04:00在 X 打开#retro gaming #emulator #web app #open source #Docker

117.0

更聪明的模型需要更少指导:精简系统提示以提升性能

Anthropic 将 Claude Code 的系统提示减少了 80%,由 @petergyang 分享。@trq212 解释说,随着模型变得更聪明,它们需要更少的约束和示例。移除过多的指导能让模型更自由地发挥,从而表现更好。 这一见解挑战了常见的高度详细系统提示做法。它表明对于更新、更强大的模型,精简上下文可以释放更好的性能和效率。这对于优化模型交互和减少 token 使用的 AI 工程师至关重要。 Claude Code 系统提示 80% 的削减展示了指令的大幅减少。其理由是示例可能会限制模型,使其过于模仿而限制了创造性解决问题。这一建议在新模型版本发布时尤其重要,因为它们通常需要更多的“运行空间”。

@trq212引用推文1 个视频working more on a post about what we learned doing this and how you can apply this to your skills and system prompts原推文媒体预览展开原推文收起原推文

@trq212

working more on a post about what we learned doing this and how you can apply this to your skills and system prompts

@petergyang

Anthropic recently cut Claude Code’s system prompt by 80%. @trq212 explains why: “As the models have gotten smarter, they need less direction, fewer constraints, and fewer examples. The examples are constraining it because now it’s like, ‘Oh, you want things like this example.’ If you remove the examples, it can actually be more free-form. All this is to say that you want to trim your context [when a new model is released]. The latest models often need more room to run.” 📌 Watch the full episode here: https://youtu.be/aVO6E181cNU

背景
系统提示是给大语言模型(LLM)的初始指令,用于设定行为、语气和约束。它们与用户提示不同,对于引导模型响应至关重要。随着 LLM 的发展,它们理解细微任务的能力提高,可能减少了对明确示例的需求。Claude Code 是 Anthropic 的 AI 编码助手,其系统提示已被公开分析其结构和工具。

7月19日 17:55在 X 打开#AI #system prompts #Claude Code #model optimization #prompt engineering

127.0

Kimi K3需求激增,暂停新订阅

月之暗面(Moonshot AI)新发布的Kimi K3模型需求远超预期,48小时内GPU容量接近极限。因此,公司已暂停新订阅,优先保障现有用户的计算资源。此外,他们计划将会员体系拆分为两个专注计划:Kimi会员(面向Web、App和工作场景)和Kimi Code会员(面向编码工作流)。 这一事件凸显了Kimi K3模型的巨大受欢迎程度和潜力,该模型是一个拥有2.8万亿参数的开源模型,可与美国顶尖系统媲美。运营挑战凸显了服务大规模AI模型的基础设施需求,并可能影响AI初创公司管理容量和定价的方式。拆分会员模式可能为更定制化的AI服务产品树立先例。 Kimi K3是一个拥有2.8万亿参数、100万token上下文窗口的模型,专为长周期编码和知识工作设计。订阅暂停是暂时的,随着容量增加,将分批重新开放新订阅。现有订阅用户不受影响,新的Kimi Code会员将专门面向使用CLI、VS Code及第三方集成等工具的开发者。

@Kimi_Moonshot原推文Kimi K3 has received far more love than we expected, and our GPUs are feeling it. Over the past 48 hours, demand has pushed close to the limits of our current capacity. To protect the experience of existing subscribers, we're temporarily pausing new subscriptions and prioritizing compute for current members. Existing subscribed users are not affected. We're adding capacity as fast as we can and will reopen new subscription spots in batches. Going forward, we'll also split membership into two more focused plans: Kimi Membership for Kimi Web, App, and Work; and Kimi Code Membership for coding workflows. This will help us match compute more precisely and keep the experience stable. Thank you for your patience and understanding!展开原推文收起原推文

@Kimi_Moonshot

Kimi K3 has received far more love than we expected, and our GPUs are feeling it. Over the past 48 hours, demand has pushed close to the limits of our current capacity. To protect the experience of existing subscribers, we're temporarily pausing new subscriptions and prioritizing compute for current members. Existing subscribed users are not affected. We're adding capacity as fast as we can and will reopen new subscription spots in batches. Going forward, we'll also split membership into two more focused plans: Kimi Membership for Kimi Web, App, and Work; and Kimi Code Membership for coding workflows. This will help us match compute more precisely and keep the experience stable. Thank you for your patience and understanding!

背景
Kimi是由中国初创公司月之暗面(Moonshot AI)开发的人工智能聊天机器人和大语言模型系列,获得阿里巴巴投资。首个版本于2023年发布,以支持12.8万token的上下文窗口而闻名。2025年7月,公司发布了开源权重模型Kimi K2,而Kimi K3在此次公告前不久推出。该模型被认为是全球最大的开源AI模型,性能可与美国公司的闭源系统相媲美。

7月19日 14:52在 X 打开#AI #model release #GPU capacity #subscription #Kimi