8月1日2026 · 星期六

从 18 条抓取中筛选 12 条 · twitter × 4 账号 · 01:58 UTC 生成

今日信号 · 高度即评分 · 点击直达


  1. DeepSeek V4-Flash 正式版 API 上线,原生适配 Codex8.0
  2. OpenAI 新增面试环节考察候选人驾驭 AI 编程智能体的能力8.0
  3. PicoLM 在 10 美元开发板上运行 10 亿参数大模型,仅需 256MB 内存8.0
  4. Agent流式聊天中的人为中断与上下文感知恢复处理7.0
  5. 阿里通义千问发布Qwen-Audio-3.0-ASR-Flash,增强上下文感知能力7.0
  6. Chops 统一管理 7 款 AI 编程工具的 Skill 文件7.0
  7. ClaudeSkills:13个实用的Claude Code技能开源发布7.0
  8. My Translator:开源实时语音翻译工具7.0
  9. Sentinel 将旧安卓手机变成 AI 监控摄像头7.0
  10. 国内AI厂商面临推理资源紧张,DeepSeek自研框架优势凸显6.0
  11. 用 PI 或 Claude Code SDK 山寨 Codex 可打造出色 AI 编程工具6.0
  12. 开发者对比Codex、ffmpeg、HyperFrames和Remotion视频生成效果5.0
018.0

DeepSeek V4-Flash 正式版 API 上线,原生适配 Codex

DeepSeek 将 V4-Flash 从预览版升级为正式版 API(版本号 0731),保持 284B 总参数、13B 激活的混合专家架构不变,但通过后训练提升了性能。该模型现在原生支持 OpenAI 的 Responses API 格式,并完全适配 Codex,无需代理即可直接集成。在多项 Agent 基准测试中,成绩已超过此前的 V4-Pro-Preview,使更便宜的 Flash 模型在编程和工具调用任务上更具竞争力。 此次发布以每百万 Token 输入 0.14 美元、输出 0.28 美元的价格提供先进的智能体编程能力,比同类模型便宜一个数量级。原生 Codex 支持消除了开发者使用 OpenAI 编程助手生态的障碍,可能加速 DeepSeek 在智能体驱动工作流中的采用。仅通过后训练就让较小模型超越较大预览版模型,凸显了微调相对于原始规模的重要性日益增加。 该模型保持 100 万 Token 上下文窗口,采用混合专家架构,总参数 284B,激活参数 13B。现在支持 Responses API 格式,这与旧的 ChatCompletions 格式不同,是 Codex 集成所必需的。DeepSeek 提供了一键配置脚本,可将所有 Codex 客户端(CLI、ChatGPT 桌面版、VS Code 扩展)切换到 V4-Flash 模型。请注意,仅 API 更新,App 和网页端模型不变,V4-Pro 正式版尚未发布。

@dotey引用推文1 张图片DeepSeek V4-Flash 正式版 API 上线,原生适配 Codex DeepSeek 今天把 V4-Flash 从预览版升级为正式版 API,版本号 0731。模型架构和参数规模没变,还是 284B 总参数、13B 激活的混合专家架构,改动集中在后训练上。 升级的核心是智能体(Agent)能力。DeepSeek 的说法是“多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview”。这句话的意思是,便宜的那个模型(Flash)经过后训练调优之后,在编程和工具调用任务上反超了贵的那个模型(Pro)的预览版。Pro 的正式版还没出,所以这个对比有时间差,但趋势本身值得关注:后训练对智能体场景的提升空间可能比很多人想的大。 另一个看点是 V4-Flash 现在原生支持 Responses API 格式,专门针对 OpenAI 的 Codex 做了适配。Codex 是 OpenAI 的 AI 编程助手,覆盖命令行工具(CLI)、ChatGPT 桌面端和 VS Code 扩展三个入口。之前 DeepSeek 的 API 只兼容 OpenAI ChatCompletions 和 Anthropic 两种格式,想接 Codex 得走代理转换。现在这个中间层不需要了,DeepSeek 甚至提供了一键配置脚本,跑完之后 Codex 所有客户端自动切换到 DeepSeek 模型。 你可以用每百万 Token 输入 0.14 美元、输出 0.28 美元的价格跑 AI 编程任务,同时享受 100 万 Token 的上下文窗口。做个对比,Codex 默认使用的 OpenAI 自家模型,同等量级的价格要贵上一个数量级。对于跑大量 Agent 循环的编程任务来说,Token 成本不是差个百分比的问题,是完全不同的成本结构。 有两点需要注意: 第一,这次只升级了 API 接口,DeepSeek 的 App 和网页端模型没有变化,普通用户暂时感知不到区别。 第二,V4-Pro 的正式版还没发布,官方只说"尽快上线",具体时间未知。原推文媒体预览展开原推文收起原推文

@dotey

DeepSeek V4-Flash 正式版 API 上线,原生适配 Codex DeepSeek 今天把 V4-Flash 从预览版升级为正式版 API,版本号 0731。模型架构和参数规模没变,还是 284B 总参数、13B 激活的混合专家架构,改动集中在后训练上。 升级的核心是智能体(Agent)能力。DeepSeek 的说法是“多项 Agent 基准成绩大幅超过此前的 V4-Pro-Preview”。这句话的意思是,便宜的那个模型(Flash)经过后训练调优之后,在编程和工具调用任务上反超了贵的那个模型(Pro)的预览版。Pro 的正式版还没出,所以这个对比有时间差,但趋势本身值得关注:后训练对智能体场景的提升空间可能比很多人想的大。 另一个看点是 V4-Flash 现在原生支持 Responses API 格式,专门针对 OpenAI 的 Codex 做了适配。Codex 是 OpenAI 的 AI 编程助手,覆盖命令行工具(CLI)、ChatGPT 桌面端和 VS Code 扩展三个入口。之前 DeepSeek 的 API 只兼容 OpenAI ChatCompletions 和 Anthropic 两种格式,想接 Codex 得走代理转换。现在这个中间层不需要了,DeepSeek 甚至提供了一键配置脚本,跑完之后 Codex 所有客户端自动切换到 DeepSeek 模型。 你可以用每百万 Token 输入 0.14 美元、输出 0.28 美元的价格跑 AI 编程任务,同时享受 100 万 Token 的上下文窗口。做个对比,Codex 默认使用的 OpenAI 自家模型,同等量级的价格要贵上一个数量级。对于跑大量 Agent 循环的编程任务来说,Token 成本不是差个百分比的问题,是完全不同的成本结构。 有两点需要注意: 第一,这次只升级了 API 接口,DeepSeek 的 App 和网页端模型没有变化,普通用户暂时感知不到区别。 第二,V4-Pro 的正式版还没发布,官方只说"尽快上线",具体时间未知。

@deepseek_ai

🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We’ve massively upgraded its Agent capabilities—benchmark scores are now far surpassing the V4-Pro-Preview. Check out the massive performance leap below! 👇 🔷 The official V4-Flash now natively supports the Responses API format and is fully adapted for Codex! Check out the configuration details in our official API docs: https://api-docs.deepseek.com/quick_start/agent_integrations/codex

背景
DeepSeek 是一家以高性价比大语言模型闻名的中国 AI 公司。V4 系列包含两个混合专家模型:V4-Pro(总参数 1.6T,激活 49B)和 V4-Flash(总参数 284B,激活 13B)。OpenAI 的 Codex 是一个轻量级编程智能体,可在终端、IDE 或桌面应用中本地运行,并使用 Responses API 格式进行模型通信。此前,在 Codex 中使用非 OpenAI 模型需要代理服务器转换 API 格式,而原生支持简化了设置。

7月31日 07:07在 X 打开#DeepSeek #AI #API #Codex #LLM

028.0

OpenAI 新增面试环节考察候选人驾驭 AI 编程智能体的能力

一位刚走完 OpenAI 软件工程师面试全流程的候选人在 Reddit 上分享了详细经历。面试新增了一个名为“智能体编程轮”的 beta 环节,要求候选人使用 AI 编程智能体在现有代码库中解决一个大型问题。面试整体偏向分布式系统能力,而非传统的算法题。 这一转变表明,OpenAI 已将熟练使用 AI 编程工具视为工程师的基本功,而非加分项。这可能会影响整个科技行业的招聘趋势,促使候选人培养问题拆解和与 AI 协作的能力。这一变化反映了 AI 智能体正日益融入真实的软件开发流程。 面试共五到六轮:招聘电话、两轮各 60 分钟的技术面(编写带版本管理的键值存储、设计有容错机制的任务调度器)、一个 48 小时的家庭作业(分布式 webhook 投递,需实现重试逻辑和死信队列),以及四轮现场面试,包括两轮编程(一轮渐进式多阶段题,一轮偏 Python 并发底层)、一轮系统设计(设计 ChatGPT,关注 GPU 分配和自动扩缩容)和一轮行为面(侧重技术领导力)。智能体编程轮目前处于 beta 阶段,并非所有候选人都会遇到。

@dotey引用推文2 张图片一位刚走 OpenAI 的软件工程师面试完全流程的候选人在 Reddit 上分享了详细经历。面试共五到六轮,整体偏向分布式系统能力,和传统大厂刷算法题的路子差别很大,面试加了一个新环节:考你指挥 AI 写代码的能力。 招聘电话先聊你对 AI 方向的判断,建议提前读 OpenAI 的公司章程。然后两轮各 60 分钟的技术面:一轮写代码(带版本管理的键值存储),一轮系统设计(有容错机制的任务调度器)。 接着是 48 小时的 take-home 项目,要交付一个能跑的系统。这位候选人拿到的题是分布式 webhook 投递,要实现重试逻辑和死信队列。做完后面试官逐行过代码,每个设计决策都得解释。 现场面试四轮:两轮编程(一轮渐进式多阶段题,一轮偏系统底层,考 Python 的生成器、异步和并发),一轮系统设计(题目是"设计 ChatGPT",重点看 GPU 分配、自动扩缩容和分布式协调),一轮行为面。行为面不收软技能套话,要的是真实的技术领导力案例,在压力下怎么推动跨团队达成共识。 最有意思的是还在 beta 阶段的第六轮:Agentic Coding Round。给你一个现有代码库加一个靠手写搞不定的大问题,要求你用 AI Coding Agent 来完成。不是所有候选人都会遇到这一轮,但方向很明确。 但它的存在已经说明了方向:在 OpenAI 眼里,“会驾驭 AI 工具写代码”正在从一个加分项变成工程师的基本功。对于正在准备 AI 公司面试的工程师来说,光刷 LeetCode 可能不够用了,怎么跟 AI 编程工具协作、怎么拆解大型问题交给 Agent 去执行,这些能力可能很快会出现在更多公司的面试流程里。原推文媒体预览+1展开原推文收起原推文

@dotey

一位刚走 OpenAI 的软件工程师面试完全流程的候选人在 Reddit 上分享了详细经历。面试共五到六轮,整体偏向分布式系统能力,和传统大厂刷算法题的路子差别很大,面试加了一个新环节:考你指挥 AI 写代码的能力。 招聘电话先聊你对 AI 方向的判断,建议提前读 OpenAI 的公司章程。然后两轮各 60 分钟的技术面:一轮写代码(带版本管理的键值存储),一轮系统设计(有容错机制的任务调度器)。 接着是 48 小时的 take-home 项目,要交付一个能跑的系统。这位候选人拿到的题是分布式 webhook 投递,要实现重试逻辑和死信队列。做完后面试官逐行过代码,每个设计决策都得解释。 现场面试四轮:两轮编程(一轮渐进式多阶段题,一轮偏系统底层,考 Python 的生成器、异步和并发),一轮系统设计(题目是"设计 ChatGPT",重点看 GPU 分配、自动扩缩容和分布式协调),一轮行为面。行为面不收软技能套话,要的是真实的技术领导力案例,在压力下怎么推动跨团队达成共识。 最有意思的是还在 beta 阶段的第六轮:Agentic Coding Round。给你一个现有代码库加一个靠手写搞不定的大问题,要求你用 AI Coding Agent 来完成。不是所有候选人都会遇到这一轮,但方向很明确。 但它的存在已经说明了方向:在 OpenAI 眼里,“会驾驭 AI 工具写代码”正在从一个加分项变成工程师的基本功。对于正在准备 AI 公司面试的工程师来说,光刷 LeetCode 可能不够用了,怎么跟 AI 编程工具协作、怎么拆解大型问题交给 Agent 去执行,这些能力可能很快会出现在更多公司的面试流程里。

@coolcoder56

OpenAI Software Engineer Interview Experience

背景
OpenAI 是一家领先的人工智能研究实验室,以 ChatGPT 和 GPT 模型闻名。传统大型科技公司的软件工程面试通常侧重于数据结构和算法(如 LeetCode 题目)。分布式系统涉及设计在多台机器上运行的软件,以处理规模扩展和故障容错。AI 编程智能体是一种能够根据高级指令自主编写、编辑和管理代码的工具。死信队列是一种用于存储重试后仍无法处理的消息的机制,常见于可靠的 webhook 投递系统。

7月31日 02:19在 X 打开#OpenAI #interview #AI coding agents #software engineering #hiring trends

038.0

PicoLM 在 10 美元开发板上运行 10 亿参数大模型,仅需 256MB 内存

PicoLM 是一个全新的纯 C11 语言编写的 LLM 推理引擎,编译后仅约 80KB 的单个二进制文件,零依赖。它能在极其受限的硬件上运行 10 亿参数模型(TinyLlama 1.1B),在 10 美元的开发板上达到每秒 1 个 token,在树莓派 5 上可达每秒 10 个 token,且运行时仅占用 45MB 内存。 这一突破使得在超低成本、低功耗设备上实现本地离线 LLM 推理成为可能,为连接有限或预算紧张的边缘 AI 应用打开了大门。它表明通过精心优化,大模型可以普及到以前被认为不可能的硬件上,有望催生新一代个人 AI 助手和嵌入式智能体。 PicoLM 支持 GGUF 格式模型,并利用内存映射实现高效加载。它针对 ARM 和 x86 架构进行了指令级优化,精简了注意力计算,并采用基于磁盘的上下文缓存,使重复提示词的处理速度提升 74%。该引擎与 PicoClaw 智能体框架共同构成完全离线的 AI 技术栈,可在同样的 10 美元 RISC-V 开发板上运行。

@GitHub_Daily原推文1 张图片用 10 美元的开发板,256MB 内存,跑十亿参数的大模型,这事真有人做出来了。 PicoLM 是纯 C 写的推理程序,编译出来单个文件约 80KB 大小,零依赖,运行占 45MB 内存。 在树莓派 5 上每秒大约 10 个 Token,树莓派 4 是 8 个,十美元那块板子也有 1 个。 GitHub:http://github.com/RightNow-AI/picolm 作者拿它给 PicoClaw 当本地大脑,两个凑一起就是个全程离线的 Agent,无需联网。 上下文缓存会存到磁盘,若是同一段提示词第二次跑直接跳过,作者实测快 74%。 针对 ARM 和 x86 分别做了指令级优化,注意力计算和缓存也都精简过。 想要在本地跑大模型预算又有限,可以看下这个项目有没有值得参考学习的。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

用 10 美元的开发板,256MB 内存,跑十亿参数的大模型,这事真有人做出来了。 PicoLM 是纯 C 写的推理程序,编译出来单个文件约 80KB 大小,零依赖,运行占 45MB 内存。 在树莓派 5 上每秒大约 10 个 Token,树莓派 4 是 8 个,十美元那块板子也有 1 个。 GitHub:http://github.com/RightNow-AI/picolm 作者拿它给 PicoClaw 当本地大脑,两个凑一起就是个全程离线的 Agent,无需联网。 上下文缓存会存到磁盘,若是同一段提示词第二次跑直接跳过,作者实测快 74%。 针对 ARM 和 x86 分别做了指令级优化,注意力计算和缓存也都精简过。 想要在本地跑大模型预算又有限,可以看下这个项目有没有值得参考学习的。

背景
大型语言模型(LLM)通常需要数 GB 内存和强大的 GPU,这使得它们难以在低成本嵌入式设备上运行。尽管量化技术和 llama.cpp 等优化推理引擎降低了资源需求,但在仅 256MB 内存的设备上运行 10 亿参数模型仍然极具挑战。PicoLM 通过极简的 C 代码库、激进的内存优化和针对特定架构的调优实现了这一目标,推动了边缘 AI 的极限。

7月31日 13:30在 X 打开#LLM #Edge AI #Optimization #Embedded #Open Source

047.0

Agent流式聊天中的人为中断与上下文感知恢复处理

一位开发者分享了在Agent流式聊天响应过程中处理人为中断的两点解决方案。该方法通过基于会话的上下文保存和截断工具调用的恢复来维护对话状态,并已在名为Stella的系统中实现。 这解决了LLM驱动的Agent中用户可能中断流式输出的常见工程难题。恰当的中断处理可确保流畅的用户体验并防止状态损坏,这对生产级对话AI系统至关重要。 该方案包含两个关键点:第一,每个任务拥有独立的会话,停止操作仅中断当前运行而不清空整个对话,上下文按sessionId保存并在恢复时重新加载。第二,若工具调用在生成后、结果返回前被中断,必须插入一个恢复结果使消息链重新合法,避免出现“存在待处理工具调用但无结果”的错误。

@xiongchun007@dotey 转推1 张图片今天面试官问我:Agent 在流式输出 Chat Response 的过程中,怎么实现人为中断和上下文感知恢复? 我说关键就两点: 第一,一个 Task 一个 Session。 用户点 Stop,只是中断当前这次 run,不是清空整个对话。所以停止时,要把当前上下文保存到对应的 sessionId 下;下一次恢复时,再根据这个 sessionId 把上下文加载回来。 第二,要处理 tool call 被截断的情况。 如果中断发生在 tool_call 已经生成、但 tool_result 还没返回的时候,消息链就是半截的。下一轮直接继续,很容易报 Pending tool calls exist without results。所以这类半截 tool_call,必须补一个 recovery result,让上下文重新变成合法状态。 一句话:Stop 停的是这次输出,不是这个 Task 的记忆。 按照这个思路,我把 Stella 的输出停止和带上下文状态恢复给做顺溜了。满分 💯原推文媒体预览展开原推文收起原推文

@dotey 转推了

@xiongchun007

今天面试官问我:Agent 在流式输出 Chat Response 的过程中,怎么实现人为中断和上下文感知恢复? 我说关键就两点: 第一,一个 Task 一个 Session。 用户点 Stop,只是中断当前这次 run,不是清空整个对话。所以停止时,要把当前上下文保存到对应的 sessionId 下;下一次恢复时,再根据这个 sessionId 把上下文加载回来。 第二,要处理 tool call 被截断的情况。 如果中断发生在 tool_call 已经生成、但 tool_result 还没返回的时候,消息链就是半截的。下一轮直接继续,很容易报 Pending tool calls exist without results。所以这类半截 tool_call,必须补一个 recovery result,让上下文重新变成合法状态。 一句话:Stop 停的是这次输出,不是这个 Task 的记忆。 按照这个思路,我把 Stella 的输出停止和带上下文状态恢复给做顺溜了。满分 💯

背景
在基于LLM的Agent中,流式响应允许逐令牌发送,但用户中断可能导致对话状态不完整。工具调用是Agent请求外部操作的常见模式;若在调用中途中断,对话历史可能包含无对应结果的工具调用,破坏预期的消息结构。会话管理对于跨多次交互维护上下文至关重要。

7月31日 23:51在 X 打开#LLM Agents #Streaming #Context Management #Tool Calls #Engineering

057.0

阿里通义千问发布Qwen-Audio-3.0-ASR-Flash,增强上下文感知能力

阿里通义千问团队发布了Qwen-Audio-3.0-ASR-Flash,这是一款新的自动语音识别模型,在上下文一致性、领域术语识别和自定义热词支持方面有显著提升。该模型还提供语音润色功能,可生成结构化文本。内部测试显示,医学术语召回率达95.36%,工业术语召回率达93.24%。 该发布解决了语音识别中的一个关键挑战:准确转录专业术语并保持对话上下文。对领域特定术语的高召回率使其在医疗、制造等需要精确术语的行业中具有重要价值。这也反映了将上下文理解融入语音模型的更广泛趋势,超越了简单的声学匹配。 该模型提供两个版本:用于实时低延迟场景的Qwen-Audio-3.0-ASR-Flash-Streaming,以及用于录制语音的Qwen-Audio-3.0-ASR-Flash-Filetrans。它支持自定义热词,允许用户将识别偏向特定术语。该模型可通过阿里云模型工作室(Model Studio)使用,模型ID为fun-asr-flash-2026-06-15,在北京和新加坡区域提供API端点。尚未宣布开源权重。

@Alibaba_Qwen原推文1 张图片Introducing Qwen-Audio-3.0-ASR-Flash: More context-aware. Stronger domain-term recognition. 🚀Our latest ASR model upgrades: • Context consistency • Domain-term recognition • Custom hotwords • Speech polishing into structured transcripts ⚡️In internal tests: • Medical term recall: 95.36% • Industrial term recall: 93.24% Qwen-Audio-3.0-ASR-Flash-Streaming: https://www.alibabacloud.com/help/en/model-studio/fun-asr-real-time-speech-recognition-api-reference Qwen-Audio-3.0-ASR-Flash-Filetrans: https://www.alibabacloud.com/help/en/model-studio/fun-asr-recorded-speech-recognition-http-api Qwen-Audio-3.0-ASR-Flash: https://www.alibabacloud.com/help/en/model-studio/non-real-time-speech-recognition-for-fun-asr-flash原推文媒体预览展开原推文收起原推文

@Alibaba_Qwen

Introducing Qwen-Audio-3.0-ASR-Flash: More context-aware. Stronger domain-term recognition. 🚀Our latest ASR model upgrades: • Context consistency • Domain-term recognition • Custom hotwords • Speech polishing into structured transcripts ⚡️In internal tests: • Medical term recall: 95.36% • Industrial term recall: 93.24% Qwen-Audio-3.0-ASR-Flash-Streaming: https://www.alibabacloud.com/help/en/model-studio/fun-asr-real-time-speech-recognition-api-reference Qwen-Audio-3.0-ASR-Flash-Filetrans: https://www.alibabacloud.com/help/en/model-studio/fun-asr-recorded-speech-recognition-http-api Qwen-Audio-3.0-ASR-Flash: https://www.alibabacloud.com/help/en/model-studio/non-real-time-speech-recognition-for-fun-asr-flash

背景
自动语音识别(ASR)将口语转换为文本。ASR中的上下文感知是指利用对话历史或主题等周边信息来提高准确性。热词是用户指定的术语,模型应优先识别,适用于专有名词或行话。Qwen-Audio是阿里推出的音频语言模型系列,此前涵盖声音理解和音乐分析等任务。这款新模型专注于具有增强上下文功能的语音识别。

7月31日 08:45在 X 打开#ASR #Qwen #speech recognition #AI model #Alibaba

067.0

Chops 统一管理 7 款 AI 编程工具的 Skill 文件

Chops 是一款新的开源工具,可统一管理 Claude Code、Cursor、Codex 等七款主流 AI 编程工具的 Skill 和 Agent 文件。它能自动扫描各工具的目录,并提供统一的界面来浏览、搜索和编辑这些文件。文件改动后界面会即时刷新,无需手动重新加载。 使用多个 AI 编程工具的开发者经常面临配置文件分散的问题,查找和更新特定规则非常繁琐。Chops 通过集中管理 Skill 文件解决了这一痛点,可显著简化工作流程并减少上下文切换的开销。随着 AI 编程助手生态的扩展和开发者越来越多地采用多工具组合,这款工具的价值尤为突出。 Chops 支持 Claude Code、Cursor、Codex 等七款主流 AI 编程工具,启动后会自动检测它们的 Skill 目录。它内置编辑器可直接修改文件,并提供合集功能将常用 Skill 归类,无需移动源文件。该工具已在 GitHub 上开源(仓库地址:Shpigford/chops),适合同时使用多个 AI 编程助手的开发者。

@GitHub_Daily原推文1 张图片用 Claude Code、Codex 好几个工具,每个都有自己的 Skill 目录,想找某条规则得挨个翻配置文件夹。 Chops 把这些工具的 Skill 和 Agent 文件统一收进一个界面,直接浏览、搜索、编辑。 支持 Claude Code、Cursor、Codex 等 7 大主流 Agent 工具,启动后自动扫描各自的目录。 GitHub:http://github.com/Shpigford/chops 内置编辑器可以直接改文件,还能用合集功能把常用的 Skill 归类,不用动源文件的位置。 文件一改动界面立刻刷新,不用手动重新加载。适合同时用好几个 AI 编程工具的朋友。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

用 Claude Code、Codex 好几个工具,每个都有自己的 Skill 目录,想找某条规则得挨个翻配置文件夹。 Chops 把这些工具的 Skill 和 Agent 文件统一收进一个界面,直接浏览、搜索、编辑。 支持 Claude Code、Cursor、Codex 等 7 大主流 Agent 工具,启动后自动扫描各自的目录。 GitHub:http://github.com/Shpigford/chops 内置编辑器可以直接改文件,还能用合集功能把常用的 Skill 归类,不用动源文件的位置。 文件一改动界面立刻刷新,不用手动重新加载。适合同时用好几个 AI 编程工具的朋友。

背景
Claude Code、Cursor 等 AI 编程工具允许用户通过配置文件定义自定义 Skill 或 Agent,这些文件通常存放在特定目录(如 .claude/skills/)中。Skill 可提供结构化指令、工作流或脚本,以扩展工具的功能。随着开发者使用多个此类工具,管理这些分散的 Skill 文件变得困难,往往需要手动在不同文件夹间切换。Chops 应运而生,它提供了一个统一界面来管理来自不同工具的 Skill。

8月1日 00:00在 X 打开#AI tools #developer tools #Claude Code #Cursor #Codex

077.0

ClaudeSkills:13个实用的Claude Code技能开源发布

开源项目ClaudeSkills精选了13个实用的Claude Code技能,涵盖调研、产品文档、PPT制作、长文写作、编程、安全审计、方案架构和性能优化等任务。其中调研技能会单独登记来源、逐条核对引用,并注明证据不足的结论;PPT技能则先出大纲和每页说明,确认后再渲染,并附带17套风格库和检查清单。 该合集降低了开发者使用Claude Code完成多样化实际任务的门槛,提升了生产力和产出质量。通过提供结构化、经过验证的工作流,它解决了引用准确性和演示设计等常见痛点,使AI辅助更加可靠和易用。 调研技能会明确登记来源、逐条核对引用,并标注证据不足的结论。PPT技能先生成大纲和每页说明,待用户确认后再渲染,并附带检查清单;其风格库提供17套主题。项目包含一份能力矩阵文档,帮助用户在安装前评估哪些技能适合自己。

@GitHub_Daily原推文1 张图片ClaudeSkills,这个开源项目精选的 13 个 Claude Code 技能,颇为实用。 涵盖调研、产品文档、做 PPT、写长文、编程、安全审计、方案架构、性能优化等技能。 GitHub:http://github.com/staruhub/ClaudeSkills 其中调研那个会把来源单独登记一份,引用逐条核对,还会写明哪些结论证据不够。 而 PPT 技能会先出大纲和每页的说明,等确认再渲染,附带一份检查清单,风格库有 17 套。 在安装之前,建议先看下项目里的一份能力矩阵文档,初步了解每个技能是否适合自己。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

ClaudeSkills,这个开源项目精选的 13 个 Claude Code 技能,颇为实用。 涵盖调研、产品文档、做 PPT、写长文、编程、安全审计、方案架构、性能优化等技能。 GitHub:http://github.com/staruhub/ClaudeSkills 其中调研那个会把来源单独登记一份,引用逐条核对,还会写明哪些结论证据不够。 而 PPT 技能会先出大纲和每页的说明,等确认再渲染,附带一份检查清单,风格库有 17 套。 在安装之前,建议先看下项目里的一份能力矩阵文档,初步了解每个技能是否适合自己。

背景
Claude Code是Anthropic推出的AI编程助手,可通过自定义技能(即模块化插件)扩展功能。技能以配置文件形式定义,并可通过GitHub仓库共享,实现社区驱动的增强。ClaudeSkills项目正是这样一组精选技能,专注于实用型非编码任务以及开发工作流。

7月31日 10:00在 X 打开#Claude Code #open source #AI tools #productivity #GitHub

087.0

My Translator:开源实时语音翻译工具

GitHub_Daily 推荐了 My Translator,这是一款开源桌面应用,能捕获系统音频或麦克风输入,并以悬浮字幕形式实时显示翻译结果。它支持四种翻译引擎,包括本地模型离线使用,并具备说话人识别功能,适用于双语对话。该工具提供 macOS 和 Windows 安装包,可直接下载使用。 对于经常观看国外模型发布会或参加国际会议的开发者和研究人员,实时翻译工具至关重要。My Translator 填补了空白,提供免费、开源的本地运行方案,无需中间服务器,保障隐私和低延迟。其自定义术语表和双栏对照功能使其适用于技术和专业场景。 该应用基于 Tauri 构建,直接从系统或麦克风捕获音频,云端引擎约两秒出结果,本地模型速度取决于设备配置。它包含双向模式,能自动识别说话人并翻译成对方语言,以及双栏对照视图,方便对比原文和译文。用户可添加自定义术语表,确保行业术语翻译一致。

@GitHub_Daily原推文1 张图片有时候看国外新模型发布会,或开远程国际会议,一直没有找到趁手的实时翻译工具。 最近找到 My Translator,能自动抓取系统声音或者麦克风,边听边转写翻译,结果浮在屏幕上。 内置四大翻译引擎,云端的只需两秒左右出结果,也可用本地模型快慢看设备配置。 GitHub:http://github.com/phuc-nt/my-translator 支持双向模式能认出是谁在说话,自动翻成对方的语言,两个人对话不用来回切设置。 还能开启双栏对照看原文和译文,可自定义字体大小,即便是投屏讲课场景,字幕也看得清。 若是有行业术语,可以自己加一份对照表,指定某个专业词语固定翻译成什么。 提供 macOS 和 Windows 安装包,经常要听外语内容的朋友可以先收藏备用。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

有时候看国外新模型发布会,或开远程国际会议,一直没有找到趁手的实时翻译工具。 最近找到 My Translator,能自动抓取系统声音或者麦克风,边听边转写翻译,结果浮在屏幕上。 内置四大翻译引擎,云端的只需两秒左右出结果,也可用本地模型快慢看设备配置。 GitHub:http://github.com/phuc-nt/my-translator 支持双向模式能认出是谁在说话,自动翻成对方的语言,两个人对话不用来回切设置。 还能开启双栏对照看原文和译文,可自定义字体大小,即便是投屏讲课场景,字幕也看得清。 若是有行业术语,可以自己加一份对照表,指定某个专业词语固定翻译成什么。 提供 macOS 和 Windows 安装包,经常要听外语内容的朋友可以先收藏备用。

背景
实时语音翻译涉及捕获音频、转写为文字、翻译文字并以最小延迟显示结果。像 My Translator 这样的开源工具利用本地处理避免将数据发送到外部服务器,从而解决隐私问题。Tauri 是一个使用 Web 技术构建轻量级桌面应用的框架,以其体积小和性能高而闻名。

7月31日 07:30在 X 打开#translation #open-source #tool #real-time #productivity

097.0

Sentinel 将旧安卓手机变成 AI 监控摄像头

一个名为 Sentinel 的 GitHub 项目将闲置的安卓手机改造成 AI 监控摄像头。它采用客户端-服务器架构,手机将视频流传输到电脑服务器,无需插件即可在浏览器中实时查看。系统支持 MP4 录制、基于传统算法的运动检测,以及可配置的视觉模型分析用于事件记录。 该项目提供了一种经济且可持续的方式重新利用旧手机,减少电子垃圾,同时提供 DIY 监控功能。它让 AI 驱动的监控变得大众化,吸引了技术爱好者和注重隐私的用户,他们更倾向于自托管方案而非商业云摄像头。 系统由安卓客户端应用和电脑端服务器组成;客户端捕获视频并发送到服务器进行处理和浏览器显示。录像按时间自动分段存为 MP4 文件,同时生成截图和日志,适合长期运行。AI 功能包括传统运动检测算法和可调节的视觉模型进行高级分析,输出事件记录。该项目开源并在 GitHub 上可用,但未详细说明具体硬件要求或性能基准。

@GitHub_Daily原推文1 张图片家里闲置了几台旧手机,一直在吃灰,扔了又可惜,挂二手卖掉又不值几个钱。 偶然发现 Sentinel 能把旧手机变成监控摄像头,装一个客户端就能用,不用另买设备。 手机负责拍,画面传到电脑上的服务端,浏览器里直接看实时画面,不用装任何插件。 GitHub:http://github.com/suzuran0y/CCTV-Smartphone-AI-Monitoring 还能自动配置,对于录像会按时间分段存成 MP4,截图和日志都有,可以长期挂着跑。 提供 AI 功能,能用传统算法看画面有没有动静,可调视觉模型进行分析,输出事件记录。 家里有闲置安卓手机的朋友,想要让它发挥最后一点余热,可以看看这个项目。原推文媒体预览展开原推文收起原推文

@GitHub_Daily

家里闲置了几台旧手机,一直在吃灰,扔了又可惜,挂二手卖掉又不值几个钱。 偶然发现 Sentinel 能把旧手机变成监控摄像头,装一个客户端就能用,不用另买设备。 手机负责拍,画面传到电脑上的服务端,浏览器里直接看实时画面,不用装任何插件。 GitHub:http://github.com/suzuran0y/CCTV-Smartphone-AI-Monitoring 还能自动配置,对于录像会按时间分段存成 MP4,截图和日志都有,可以长期挂着跑。 提供 AI 功能,能用传统算法看画面有没有动静,可调视觉模型进行分析,输出事件记录。 家里有闲置安卓手机的朋友,想要让它发挥最后一点余热,可以看看这个项目。

背景
传统运动检测使用帧差法或背景减除等算法识别移动物体,而基于 AI 的视觉模型(如深度学习)可以分类物体并减少误报。将旧智能手机改造成 IP 摄像头是一种常见的 DIY 做法,利用其内置摄像头和网络连接。Sentinel 将这些概念结合成一个集成的开源监控解决方案。

7月31日 04:00在 X 打开#open-source #surveillance #AI #DIY #smartphone

106.0

国内AI厂商面临推理资源紧张,DeepSeek自研框架优势凸显

智谱AI的GLM编程套餐近期大幅涨价,Lite套餐从约49元涨至118元,而使用量不变。相比之下,DeepSeek凭借自研推理框架和国产硬件继续大幅降价。这一分化凸显了长期投资自研技术的战略优势。 这一发展凸显了推理基础设施在AI竞争格局中的关键作用。在高端GPU获取受限的情况下,中国厂商必须在软件和国产芯片上创新才能保持竞争力。DeepSeek在他人涨价时仍能降价,可能重塑市场格局,加速高性价比AI服务的普及。 GLM的Lite套餐价格从约49元涨至118元,而OpenAI同期将Luna降价80%、Terra降价20%。DeepSeek的成本优势源于其自研推理框架和对国产芯片的优化,使其能持续降价。GLM编程套餐提供GLM-5.2和GLM-5-Turbo模型,用于Claude Code、Cline等AI编程工具。

@Keji715@Pluvio9yte 转推1 张图片国内的厂商对比美国来说,可以拿出来卖token的推理资源太有限了,还要兼顾一下模型迭代的问题,GLM也是无奈之举。 不过这时候对比deepseek,就看出来长期深耕自研的推理框架+国产卡的优势了,这种时候deepseek还能继续大幅度降价,果然一开始做困难的事情,后面会越来越容易。原推文媒体预览展开原推文收起原推文

@Pluvio9yte 转推了

@Keji715

国内的厂商对比美国来说,可以拿出来卖token的推理资源太有限了,还要兼顾一下模型迭代的问题,GLM也是无奈之举。 不过这时候对比deepseek,就看出来长期深耕自研的推理框架+国产卡的优势了,这种时候deepseek还能继续大幅度降价,果然一开始做困难的事情,后面会越来越容易。

@Pluvio9yte

GLM的套餐也太离谱了,终于放开套餐了,用量没变的情况下,价格直接从149翻3倍多到了538 同一天OpenAI还进行了大降价: • OpenAI:Luna 砍 80%、Terra 砍 20% • 智谱 GLM Coding Plan:开放订阅但涨价,Lite 大约 49 → 118 元 😅

背景
中国AI公司面临美国出口管制,限制获取先进GPU,被迫依赖国产替代品。DeepSeek大力投资定制推理框架和硬件适配,降低了运营成本。GLM由智谱AI开发,是国内外市场的主要中文大语言模型之一。AI编程套餐市场正在增长,用户订阅以获取针对代码生成优化的模型。
社区讨论
原始推文和转推对GLM涨价表示不满,并与DeepSeek的降价形成对比。评论者指出,DeepSeek早期在困难的自研技术上的投入如今获得回报,而GLM因推理资源有限被迫涨价。舆论倾向于认可DeepSeek的长期战略。

7月31日 10:07在 X 打开#AI #LLM #China #pricing #inference

116.0

用 PI 或 Claude Code SDK 山寨 Codex 可打造出色 AI 编程工具

@dotey 的一条推文指出,使用 PI 或 Claude Code 的 SDK 来山寨 OpenAI 的 Codex,并搭配聪明的模型,就能打造出高质量的 AI 编程体验。作者认为大厂之所以效果不佳,是因为不愿山寨、什么都从头搭建,且只能使用自家有限的模型。 这段评论揭示了在竞争激烈的 AI 编程工具市场中,一种务实的产品策略:利用现有的 SDK 和模型可以加速开发并提升用户体验。这意味着小团队或初创公司可以通过在成熟基础上构建,而非重复造轮子,来有效竞争。 推文特别提到 PI 和 Claude Code 的 SDK 是可行的基础,并强调使用更聪明的模型至关重要。它暗示 Codex 的核心功能无需从头构建即可复制,而大公司不愿采用这种方法导致了产品效果不佳。

@dotey

只要去山寨 Codex,体验就不会差;底层只要用 PI 或者 Claude Code 的 SDK,那功能就不会差;只要接聪明一点的模型,能力就不会差。大厂如果舍不得落下脸山寨、什么都要从头搭、还只能用有限的自家模型,那效果当然不会好,人也不会少。

背景
OpenAI Codex 是集成在 ChatGPT 中的 AI 编程智能体,可帮助开发者完成拉取请求、重构和代码审查等任务。Claude Code 是 Anthropic 的终端编程工具,其 SDK 支持程序化集成。PI 是一个终端编程智能体,提供 SDK 用于构建自定义 AI 编程工具。这条推文反映了科技界常见的争论:是自研专有方案还是利用现有平台。

7月31日 05:27在 X 打开#AI coding tools #Codex #Claude Code #SDK #product strategy

125.0

开发者对比Codex、ffmpeg、HyperFrames和Remotion视频生成效果

一位开发者使用Codex,分别通过Python+ffmpeg、HyperFrames和Remotion三种方式生成相同脚本的视频。音频部分则采用了火山引擎的seed-tts-2.0。该对比展示了不同视频生成工作流的实际差异。 该对比为开发者选择自动化视频创作工具提供了实用参考。它反映了AI辅助视频生成生态的蓬勃发展,HyperFrames和Remotion等工具在传统ffmpeg脚本之上提供了更高层次的抽象。这类实验有助于社区理解灵活性、易用性和输出质量之间的权衡。 开发者首先使用Python+ffmpeg作为基线,随后用HyperFrames(通过HTML/CSS/JS渲染视频)和Remotion(基于React的视频框架)复现了相同脚本。音频统一由火山引擎的seed-tts-2.0生成,该模型支持声音复刻和文本转语音。推文中未分享性能指标或定性结果。

@dannykkg@Pluvio9yte 转推1 个视频参考乌云兄弟的文章,让 Codex 做了一个视频的对比。音频直接用火山seed-tts-2.0。 最开始直接用 python+ffmpeg,然后分别又用 HyperFrames 和 Remotion 做了相同脚本和长度的。原推文媒体预览展开原推文收起原推文

@Pluvio9yte 转推了

@dannykkg

参考乌云兄弟的文章,让 Codex 做了一个视频的对比。音频直接用火山seed-tts-2.0。 最开始直接用 python+ffmpeg,然后分别又用 HyperFrames 和 Remotion 做了相同脚本和长度的。

背景
Codex可能指OpenAI的代码生成模型,在此用于编写视频脚本。ffmpeg是一个命令行视频处理工具。HyperFrames是较新的工具,允许AI代理通过编写网页代码来合成视频,源自HeyGen。Remotion让开发者能用React以编程方式创建视频。火山引擎的seed-tts-2.0是字节跳动推出的语音合成模型,提供高质量的声音复刻和TTS功能。

7月31日 10:28在 X 打开#video generation #Codex #ffmpeg #Remotion #TTS