- Kimi K3 在 ValsAI 的 Vibe Code Bench 上以 85.0% 排名第二8.0
- 模型公司FDE阳谋:捕获企业知识,取代软件工程师8.0
- OpenMOSS 发布 MOSS-Transcribe-Diarize-0.9B 端到端多人语音转录模型8.0
- 泄露基准测试显示 Qwen3.8 比肩 Claude Opus 4.8,即将开源8.0
- OpenHack:开源智能体安全扫描工具,全程本地运行8.0
- 对唯参数论模型评价的批判:Kimi K3 与 Fable 5 的用户体验对比7.0
- Claude Code 团队揭示 /loop、/goal、工作流及系统提示缩减 80%7.0
- ACE-Step Studio:免费离线AI音乐生成工具发布7.0
- lazyssh:一款从 SSH config 浏览和连接服务器的终端 SSH 管理器7.0
- RetroAssembly:带现代功能的浏览器复古游戏模拟器7.0
- 更聪明的模型需要更少指导:精简系统提示以提升性能7.0
- Kimi K3需求激增,暂停新订阅7.0
018.0
Kimi K3 在 ValsAI 的 Vibe Code Bench 上以 85.0% 排名第二
月之暗面推出的 Kimi K3 是一个 2.8 万亿参数的开源模型,在 ValsAI 的 Vibe Code Bench 上以 85.0% 的得分排名第二。该基准测试评估模型根据自然语言提示从零开始构建完整网页应用的能力。这一成绩凸显了 Kimi K3 强大的自主编程能力。 这一排名表明,中国的开源模型在实际软件工程任务中正变得与顶尖闭源系统不相上下。它预示着 AI 能够自主处理端到端开发,可能加速原型设计并降低非编程人员的门槛。这一结果可能影响企业采用率和对大规模开源模型的进一步投资。 Kimi K3 拥有 2.8 万亿参数、100 万 token 的上下文窗口,并采用 Kimi Delta Attention(KDA)混合线性注意力机制。Vibe Code Bench 包含 100 个真实的网页应用规格,分为公开验证集和私有测试集。Kimi K3 的 85.0% 得分使其仅次于第一名,但推文中未透露领先模型的身份。该模型可通过 API 使用,定价为每百万输入 token 3 美元,每百万输出 token 15 美元。
背景
Vibe Code Bench 是 Vals AI 创建的基准测试,用于检验 AI 模型能否根据自然语言描述生成完整、可部署的网页应用。它专注于“从零到一”的创建,即模型必须在没有人工干预的情况下生成所有必要的代码。Kimi K3 是由北京初创公司月之暗面开发的多模态推理模型,该公司获得阿里巴巴投资。该模型以其庞大的规模和开源发布而引人注目,是公开可用的最大模型之一。这类基准测试对于衡量 AI 驱动软件开发领域的进展至关重要,该领域是各大 AI 实验室激烈竞争的焦点。
7月19日 04:10在 X 打开#AI #LLM #coding #benchmark #Kimi
028.0
模型公司FDE阳谋:捕获企业知识,取代软件工程师
模型公司正在部署现场交付工程师(FDE)帮助企业落地AI智能体,在销售Token的同时系统性地将领域知识沉淀为可复用的技能(Skills)。这些技能随后被内化到模型中,减少了对人类工程师的需求,若业务未随之拓展,可能导致裁员。 这一策略标志着范式转变:AI公司直接将企业知识货币化,将其转化为不断增值的资产。它威胁到传统的软件工程师岗位,但也为懂AI的工程师创造了暂时的生存空间,凸显了AI驱动效率提升的双重性。 FDE模式由Palantir首创,将工程师嵌入客户组织以定制解决方案并将洞察反馈至产品开发。引用的推文强调构建“飞轮”:将每个项目的沟通、需求、交付方案和结果结构化,形成知识库和评估标准,使AI智能体能生成基础方案并持续改进。这一过程将组织能力转化为超越个体员工的系统。
背景
现场交付工程师(FDE)是在客户现场工作以实施和定制软件的技术人员,该模式由Palantir推广。在AI领域,FDE帮助企业采用AI智能体,即执行任务的自主程序。“技能”指封装的领域知识或流程,可供AI智能体执行。内化意味着将这些技能直接嵌入AI模型,减少对外部提示或人工干预的依赖。这一趋势反映了行业向利用企业数据学习以自动化复杂工作流的AI系统的广泛转变。
社区讨论
讨论强化了原帖观点,通过一个详细示例说明将项目产物结构化为知识库可创建自我改进的交付系统。评论者一致认为,这种方法将组织知识转化为持久资产,减少对个人才能的依赖,使普通团队成员也能高水平发挥。
7月19日 15:47在 X 打开#AI Agents #Enterprise AI #FDE #Knowledge Capture #Job Displacement
038.0
OpenMOSS 发布 MOSS-Transcribe-Diarize-0.9B 端到端多人语音转录模型
OpenMOSS 开源了 MOSS-Transcribe-Diarize-0.9B,一个 0.9B 参数的端到端模型,可一次性完成长音频转录、说话人分离和精确时间戳标注。它能在单张 RTX 4090 上单次处理最长 90 分钟的音频,实时率仅为 0.017。该模型将语音识别、说话人标注和时间对齐统一为一个自回归任务,无需额外的说话人分离或对齐模型。 该模型简化了传统的多阶段会议转录流程,使高质量、带说话人标注的转写更易获取且更高效。它降低了计算开销和集成复杂度,有利于开发会议助手、字幕工具和语音分析应用。其 Apache 2.0 开源协议允许商用,有望降低相比云端方案的成本。 架构采用 Whisper-Medium 编码器与 Qwen3-0.6B 风格解码器,支持 128K 上下文和 50 多种语言。模型不支持标点符号,自定义提示和热词可能未生效。转录速度比 Qwen3-ASR-0.6B 慢,但可直接输出带说话人标签的片段,无需 Pyannote 或 WeSpeaker。更强的“Pro”版本将通过 API 提供。
背景
传统的带说话人标注的转录通常需要级联多个独立模型:语音识别(ASR)获取文本,说话人分离(如 Pyannote、WeSpeaker)标注谁在何时说话,以及强制对齐(如 Qwen3-ForcedAligner)优化时间戳。MOSS-Transcribe-Diarize 将这些步骤合并为一个模型,降低了延迟和复杂度。Qwen3-ASR 是近期轻量级 ASR 模型,配合其强制对齐器可获得精准时间戳。Whisper 是流行的 ASR 模型,但在时间戳准确性和说话人识别方面存在不足。
社区讨论
开发者 @dotey 指出,虽然该模型便于端到端带说话人标注的转录,但速度比 Qwen3-ASR 慢,不支持标点,且热词/提示功能可能未生效。他们此前使用 Whisper 发现时间戳不准、中英混排支持差,并测试了 Qwen3-ASR 配合强制对齐获得更好效果。对于高要求场景,推荐使用豆包等云端服务,尽管成本较高。
7月19日 06:48在 X 打开#ASR #speaker diarization #open-source #AI #audio processing
048.0
泄露基准测试显示 Qwen3.8 比肩 Claude Opus 4.8,即将开源
阿里巴巴 Qwen3.8 的内部基准测试结果泄露,显示其净胜率比上一代 Qwen3.7-Max 提升了 22.8%。该模型超越了 KIMI-K3 和 GLM-5.2,与 Claude Opus 4.8 几乎持平,仅落后 1.8 个百分点。预览版已在 Token Plan、Qoder 和 QoderWork 上线。 这些结果使 Qwen3.8 成为顶级开源权重模型,直接与 Claude Opus 4.8 等闭源巨头竞争。其强大的编码和智能体能力可能加速在企业工作流和开发者工具中的应用。计划中的开源发布或将进一步普及前沿 AI 性能。 Qwen3.8 是一个 2.4 万亿参数模型,预览版在全栈开发、多智能体编排和长时间任务中表现出色。它仅在 Fable-5-Xhigh 面前明显落后,后者被认为是最强的闭源代码模型之一。预览版定价为 10 单位(货币未指定),可通过阿里巴巴平台访问。
背景
Qwen 是阿里巴巴的大语言模型系列,Qwen3.7-Max 是上一代旗舰。Claude Opus 4.8 是 Anthropic 最新的高端模型,以编码和智能体任务见长。Fable-5-Xhigh 是 Anthropic 的 Claude Fable 5 的一个努力级别,针对复杂编码优化。KIMI-K3 和 GLM-5.2 是竞品中国 AI 模型。开源权重模型允许用户访问和修改模型参数,促进社区创新。
7月19日 17:03在 X 打开#AI #LLM #Qwen #benchmark #model release
058.0
OpenHack:开源智能体安全扫描工具,全程本地运行
OpenHack 是一款新发布的开源智能体安全扫描工具,全程使用开源模型在本地运行。它执行侦察、狩猎、验证和复核四个阶段,甚至会在 Docker 沙箱中发起真实攻击来验证漏洞。该工具为每个发现的问题提供严重程度、代码片段和修复建议。 该工具解决了开发者的两大痛点:商业安全扫描工具的高昂费用和将代码上传到云端的隐私风险。通过使用开源模型在本地运行,OpenHack 使持续安全扫描变得经济且私密,有望为小团队和个人开发者普及高级漏洞检测能力。 OpenHack 使用四阶段流水线:侦察、狩猎、验证和复核。它包含沙箱模式,在 Docker 容器内执行真实的漏洞利用尝试以确认漏洞。该工具开源并托管在 GitHub 上,可通过命令行安装。它仅使用开源模型,确保不依赖专有服务。
背景
传统的安全扫描通常依赖商业工具,这些工具收费高昂且需要将代码上传到云端服务器,引发隐私担忧。智能体安全扫描器使用 AI 智能体自主探索和测试代码库,模拟人类安全研究人员。开源模型是公开可用的 AI 模型,可以在本地运行,避免数据泄露。Docker 容器提供隔离环境,用于安全执行可能有危害的代码。
7月19日 07:30在 X 打开#security #open-source #devtools #privacy #AI
067.0
对唯参数论模型评价的批判:Kimi K3 与 Fable 5 的用户体验对比
X 上的一篇技术讨论反对唯参数论,对比了 Kimi K3 与 Claude Fable 5。作者认为 Kimi K3 的单次生成能力很强,但在长上下文中的性能衰减更早出现;而 Fable 5 全面的长尾数据训练保证了持续稳定的性能,在多步骤任务中的成功率显著更高。 该分析凸显了 AI 模型评价从原始基准测试向真实用户体验的转变,尤其是在非程序员用户涌入市场的背景下。它强调了模型设计选择(如优先单次成功还是长上下文可靠性)如何影响用户满意度和采用率,以及情感设计原则在感知模型质量中的作用。 Kimi K3 是一个 2.8 万亿参数模型,拥有 100 万 token 上下文窗口,但在上下文长度 40-50% 时性能衰减明显。Fable 5 是 Anthropic 的 Mythos 级模型,在上下文长度 80-90% 时才出现急剧性能衰减。作者计算,将每步失败概率减半可使 50 步任务成功率提升近 4 倍。讨论还指出,Kimi K3 的单次生成优势吸引了 2026 年的非程序员办公人群,而专业开发者更看重长上下文可靠性。
背景
Kimi K3 是中国初创公司月之暗面开发的大语言模型,定位为面向长程编程和知识工作的前沿模型。Claude Fable 5 是 Anthropic 的模型,专为安全通用用途设计,具有强大的长上下文性能。“单次生成”指模型在首次尝试时即生成正确输出的能力。“长尾数据”指罕见或边缘案例,对模型在多样化真实场景中的稳健性能至关重要。情感设计是一种用户体验概念,强调产品应唤起积极情绪以提升用户满意度。
社区讨论
讨论中引用了一条评论,认为大多数用户对中等水平模型已感满意,参数数量和基准测试的炒作驱动了用户感知。原作者表示同意,但补充说用户人群正在变化,使得单次生成能力更受非程序员群体重视。
7月19日 18:43在 X 打开#AI models #model evaluation #user experience #LLM comparison #technical analysis
077.0
Claude Code 团队揭示 /loop、/goal、工作流及系统提示缩减 80%
Claude Code 团队的 Thariq 解释了 /loop、/goal 和工作流如何支持长时间运行的自主代理。他还透露 Claude Code 的系统提示已缩减 80%,因为新模型需要的指导更少。现场演示展示了使用 Claude Code 编辑发布视频。 这些功能使 AI 代理在长时间的软件工程任务中更实用,减少了人工监督。系统提示的大幅缩减标志着向更精简、能力更强的模型转变,这些模型需要更少的约束。这影响了寻求高效、自主编码助手的开发者。 /loop 以设定的间隔重复提示,用于轮询或检查;/goal 让代理自主工作直到满足条件,最好与自动模式配合使用。工作流将这些组合用于复杂的多步骤任务。系统提示的缩减得益于 Claude 4 Fable 5 模型推理能力的提升。
背景
Claude Code 是 Anthropic 推出的一款终端内 AI 编码助手。系统提示是指导 AI 行为的指令;如果模型足够智能,减少系统提示可以提高性能。/loop、/goal 和工作流是允许代理长时间自主运行而无需持续用户输入的命令。
7月19日 17:23在 X 打开#Claude Code #AI agents #workflows #system prompt optimization #software engineering
087.0
ACE-Step Studio:免费离线AI音乐生成工具发布
ACE-Step Studio 是一款新发布的开源AI音乐生成工具,完全在本地Nvidia GPU上离线运行。它能够生成最长8分钟、带人声的完整歌曲,支持翻唱改编和局部重绘,并包含AI歌词生成功能。该工具无需订阅或API密钥即可免费使用,且会自动安装适配显卡的优化版本。 该工具为Suno等基于订阅的AI音乐服务提供了免费、无限制的替代方案,消除了成本障碍和云端依赖。它使音乐人、爱好者和研究人员能够在本地进行AI音乐生成实验,促进创作并保护隐私。其开源特性也有助于社区贡献和定制化开发。 ACE-Step Studio 需要至少12GB显存的Nvidia GPU(若不使用offload则推荐20GB)。它采用本地DiT模型和语言模型进行音乐生成,并可选配云端服务以提升质量。该工具包含视频工作室,可制作MV和卡拉OK字幕,并提供一键安装流程。
背景
像Suno这样的AI音乐生成工具允许用户通过文本提示创作歌曲,但通常需要付费订阅才能大量使用。ACE-Step Studio基于ACE-Step 1.5模型构建,这是一个强大的本地音乐生成系统。它利用扩散Transformer(DiT)架构和语言模型来生成带人声的连贯音乐。本地运行确保了隐私并避免重复费用,但需要较高的GPU资源。
7月19日 13:30在 X 打开#AI music #open source #offline #generative AI #GitHub
097.0
lazyssh:一款从 SSH config 浏览和连接服务器的终端 SSH 管理器
lazyssh 是一款新的终端 SSH 管理器,它能读取本地 SSH config 文件,并以可搜索的交互式列表展示所有服务器。它支持按别名、IP 或标签进行模糊搜索,一键连接,置顶常用服务器,并能在界面内直接编辑端口转发、跳板主机等高级选项。该工具在修改 SSH config 前会自动备份。 管理大量服务器常导致 SSH config 文件臃肿,难以记住并快速连接特定主机。lazyssh 通过提供快速的键盘驱动界面,简化了服务器访问和配置,为开发者和运维工程师节省时间。其模糊搜索和置顶功能减少了日常工作流中的摩擦,提升了多服务器环境下的效率。 lazyssh 受 lazydocker 和 k9s 等工具启发,专为 SSH 主机管理而构建。它读取标准的 ~/.ssh/config 文件,并允许交互式地添加、编辑、置顶、ping 和删除条目。该工具支持本地与远程机器之间的文件传输,并在任何修改前自动备份 SSH config。它是开源的,可在 GitHub 仓库 Adembc/lazyssh 获取。
背景
SSH(安全外壳协议)是用于安全连接远程服务器的协议,SSH config 文件(~/.ssh/config)存储了不同服务器的主机名、用户名和密钥等连接设置。随着管理的服务器数量增加,该文件可能变得冗长且难以浏览。模糊搜索是一种查找近似匹配的技术,允许用户使用部分或拼写错误的查询进行搜索。像 lazyssh 这样的终端用户界面(TUI)提供了键盘驱动的交互方式,以提高速度和效率,常用于开发者工具。
7月19日 10:00在 X 打开#SSH #DevOps #Tool #Productivity #Server Management
107.0
RetroAssembly:带现代功能的浏览器复古游戏模拟器
RetroAssembly 是一个新的网页端模拟器,将 NES、SNES、Genesis、GameBoy 和街机等经典游戏机直接搬进浏览器,省去了复杂的配置过程。它能自动为上传的 ROM 匹配封面图,实时同步存档,并为部分模拟器提供倒带功能。该平台开源,并可通过 Docker 自托管。 该工具通过省去手动配置模拟器的麻烦,让玩家在任何有浏览器的设备上都能访问游戏库,大大降低了重温老游戏的门槛。云存档同步和倒带功能提升了游戏体验,对怀旧玩家和新手都很有吸引力。其开源性质和 Docker 支持也满足了注重隐私和喜欢自托管的用户需求。 RetroAssembly 支持键盘、手柄和屏幕虚拟摇杆操作,因此可在移动设备上畅玩。用户需自行上传合法获取的 ROM 文件,平台不提供受版权保护的游戏。官方托管版本可在 retroassembly.com 使用,源代码托管在 GitHub 的 arianrhodsandlot/retroassembly 仓库中。
背景
复古游戏模拟器通过软件模拟旧游戏机的硬件,让经典游戏在现代设备上运行。传统上,配置模拟器需要下载不同程序、设置 BIOS 文件并管理 ROM,对普通用户来说颇为繁琐。基于浏览器的模拟利用 WebAssembly 等技术直接在网页中运行模拟器核心,简化了访问流程。RetroAssembly 在此基础上提供了统一的界面,具备游戏库管理和云功能,类似于商业服务但可自托管。
7月19日 04:00在 X 打开#retro gaming #emulator #web app #open source #Docker
117.0
更聪明的模型需要更少指导:精简系统提示以提升性能
Anthropic 将 Claude Code 的系统提示减少了 80%,由 @petergyang 分享。@trq212 解释说,随着模型变得更聪明,它们需要更少的约束和示例。移除过多的指导能让模型更自由地发挥,从而表现更好。 这一见解挑战了常见的高度详细系统提示做法。它表明对于更新、更强大的模型,精简上下文可以释放更好的性能和效率。这对于优化模型交互和减少 token 使用的 AI 工程师至关重要。 Claude Code 系统提示 80% 的削减展示了指令的大幅减少。其理由是示例可能会限制模型,使其过于模仿而限制了创造性解决问题。这一建议在新模型版本发布时尤其重要,因为它们通常需要更多的“运行空间”。
背景
系统提示是给大语言模型(LLM)的初始指令,用于设定行为、语气和约束。它们与用户提示不同,对于引导模型响应至关重要。随着 LLM 的发展,它们理解细微任务的能力提高,可能减少了对明确示例的需求。Claude Code 是 Anthropic 的 AI 编码助手,其系统提示已被公开分析其结构和工具。
7月19日 17:55在 X 打开#AI #system prompts #Claude Code #model optimization #prompt engineering
127.0
Kimi K3需求激增,暂停新订阅
月之暗面(Moonshot AI)新发布的Kimi K3模型需求远超预期,48小时内GPU容量接近极限。因此,公司已暂停新订阅,优先保障现有用户的计算资源。此外,他们计划将会员体系拆分为两个专注计划:Kimi会员(面向Web、App和工作场景)和Kimi Code会员(面向编码工作流)。 这一事件凸显了Kimi K3模型的巨大受欢迎程度和潜力,该模型是一个拥有2.8万亿参数的开源模型,可与美国顶尖系统媲美。运营挑战凸显了服务大规模AI模型的基础设施需求,并可能影响AI初创公司管理容量和定价的方式。拆分会员模式可能为更定制化的AI服务产品树立先例。 Kimi K3是一个拥有2.8万亿参数、100万token上下文窗口的模型,专为长周期编码和知识工作设计。订阅暂停是暂时的,随着容量增加,将分批重新开放新订阅。现有订阅用户不受影响,新的Kimi Code会员将专门面向使用CLI、VS Code及第三方集成等工具的开发者。
背景
Kimi是由中国初创公司月之暗面(Moonshot AI)开发的人工智能聊天机器人和大语言模型系列,获得阿里巴巴投资。首个版本于2023年发布,以支持12.8万token的上下文窗口而闻名。2025年7月,公司发布了开源权重模型Kimi K2,而Kimi K3在此次公告前不久推出。该模型被认为是全球最大的开源AI模型,性能可与美国公司的闭源系统相媲美。
7月19日 14:52在 X 打开#AI #model release #GPU capacity #subscription #Kimi