- DeepSeek V4-Flash 正式版 API 上线,原生适配 Codex8.0
- OpenAI 新增面试环节考察候选人驾驭 AI 编程智能体的能力8.0
- PicoLM 在 10 美元开发板上运行 10 亿参数大模型,仅需 256MB 内存8.0
- Agent流式聊天中的人为中断与上下文感知恢复处理7.0
- 阿里通义千问发布Qwen-Audio-3.0-ASR-Flash,增强上下文感知能力7.0
- Chops 统一管理 7 款 AI 编程工具的 Skill 文件7.0
- ClaudeSkills:13个实用的Claude Code技能开源发布7.0
- My Translator:开源实时语音翻译工具7.0
- Sentinel 将旧安卓手机变成 AI 监控摄像头7.0
- 国内AI厂商面临推理资源紧张,DeepSeek自研框架优势凸显6.0
- 用 PI 或 Claude Code SDK 山寨 Codex 可打造出色 AI 编程工具6.0
- 开发者对比Codex、ffmpeg、HyperFrames和Remotion视频生成效果5.0
018.0
DeepSeek V4-Flash 正式版 API 上线,原生适配 Codex
DeepSeek 将 V4-Flash 从预览版升级为正式版 API(版本号 0731),保持 284B 总参数、13B 激活的混合专家架构不变,但通过后训练提升了性能。该模型现在原生支持 OpenAI 的 Responses API 格式,并完全适配 Codex,无需代理即可直接集成。在多项 Agent 基准测试中,成绩已超过此前的 V4-Pro-Preview,使更便宜的 Flash 模型在编程和工具调用任务上更具竞争力。 此次发布以每百万 Token 输入 0.14 美元、输出 0.28 美元的价格提供先进的智能体编程能力,比同类模型便宜一个数量级。原生 Codex 支持消除了开发者使用 OpenAI 编程助手生态的障碍,可能加速 DeepSeek 在智能体驱动工作流中的采用。仅通过后训练就让较小模型超越较大预览版模型,凸显了微调相对于原始规模的重要性日益增加。 该模型保持 100 万 Token 上下文窗口,采用混合专家架构,总参数 284B,激活参数 13B。现在支持 Responses API 格式,这与旧的 ChatCompletions 格式不同,是 Codex 集成所必需的。DeepSeek 提供了一键配置脚本,可将所有 Codex 客户端(CLI、ChatGPT 桌面版、VS Code 扩展)切换到 V4-Flash 模型。请注意,仅 API 更新,App 和网页端模型不变,V4-Pro 正式版尚未发布。
背景
DeepSeek 是一家以高性价比大语言模型闻名的中国 AI 公司。V4 系列包含两个混合专家模型:V4-Pro(总参数 1.6T,激活 49B)和 V4-Flash(总参数 284B,激活 13B)。OpenAI 的 Codex 是一个轻量级编程智能体,可在终端、IDE 或桌面应用中本地运行,并使用 Responses API 格式进行模型通信。此前,在 Codex 中使用非 OpenAI 模型需要代理服务器转换 API 格式,而原生支持简化了设置。
7月31日 07:07在 X 打开#DeepSeek #AI #API #Codex #LLM
028.0
OpenAI 新增面试环节考察候选人驾驭 AI 编程智能体的能力
一位刚走完 OpenAI 软件工程师面试全流程的候选人在 Reddit 上分享了详细经历。面试新增了一个名为“智能体编程轮”的 beta 环节,要求候选人使用 AI 编程智能体在现有代码库中解决一个大型问题。面试整体偏向分布式系统能力,而非传统的算法题。 这一转变表明,OpenAI 已将熟练使用 AI 编程工具视为工程师的基本功,而非加分项。这可能会影响整个科技行业的招聘趋势,促使候选人培养问题拆解和与 AI 协作的能力。这一变化反映了 AI 智能体正日益融入真实的软件开发流程。 面试共五到六轮:招聘电话、两轮各 60 分钟的技术面(编写带版本管理的键值存储、设计有容错机制的任务调度器)、一个 48 小时的家庭作业(分布式 webhook 投递,需实现重试逻辑和死信队列),以及四轮现场面试,包括两轮编程(一轮渐进式多阶段题,一轮偏 Python 并发底层)、一轮系统设计(设计 ChatGPT,关注 GPU 分配和自动扩缩容)和一轮行为面(侧重技术领导力)。智能体编程轮目前处于 beta 阶段,并非所有候选人都会遇到。
背景
OpenAI 是一家领先的人工智能研究实验室,以 ChatGPT 和 GPT 模型闻名。传统大型科技公司的软件工程面试通常侧重于数据结构和算法(如 LeetCode 题目)。分布式系统涉及设计在多台机器上运行的软件,以处理规模扩展和故障容错。AI 编程智能体是一种能够根据高级指令自主编写、编辑和管理代码的工具。死信队列是一种用于存储重试后仍无法处理的消息的机制,常见于可靠的 webhook 投递系统。
7月31日 02:19在 X 打开#OpenAI #interview #AI coding agents #software engineering #hiring trends
038.0
PicoLM 在 10 美元开发板上运行 10 亿参数大模型,仅需 256MB 内存
PicoLM 是一个全新的纯 C11 语言编写的 LLM 推理引擎,编译后仅约 80KB 的单个二进制文件,零依赖。它能在极其受限的硬件上运行 10 亿参数模型(TinyLlama 1.1B),在 10 美元的开发板上达到每秒 1 个 token,在树莓派 5 上可达每秒 10 个 token,且运行时仅占用 45MB 内存。 这一突破使得在超低成本、低功耗设备上实现本地离线 LLM 推理成为可能,为连接有限或预算紧张的边缘 AI 应用打开了大门。它表明通过精心优化,大模型可以普及到以前被认为不可能的硬件上,有望催生新一代个人 AI 助手和嵌入式智能体。 PicoLM 支持 GGUF 格式模型,并利用内存映射实现高效加载。它针对 ARM 和 x86 架构进行了指令级优化,精简了注意力计算,并采用基于磁盘的上下文缓存,使重复提示词的处理速度提升 74%。该引擎与 PicoClaw 智能体框架共同构成完全离线的 AI 技术栈,可在同样的 10 美元 RISC-V 开发板上运行。
背景
大型语言模型(LLM)通常需要数 GB 内存和强大的 GPU,这使得它们难以在低成本嵌入式设备上运行。尽管量化技术和 llama.cpp 等优化推理引擎降低了资源需求,但在仅 256MB 内存的设备上运行 10 亿参数模型仍然极具挑战。PicoLM 通过极简的 C 代码库、激进的内存优化和针对特定架构的调优实现了这一目标,推动了边缘 AI 的极限。
7月31日 13:30在 X 打开#LLM #Edge AI #Optimization #Embedded #Open Source
047.0
Agent流式聊天中的人为中断与上下文感知恢复处理
一位开发者分享了在Agent流式聊天响应过程中处理人为中断的两点解决方案。该方法通过基于会话的上下文保存和截断工具调用的恢复来维护对话状态,并已在名为Stella的系统中实现。 这解决了LLM驱动的Agent中用户可能中断流式输出的常见工程难题。恰当的中断处理可确保流畅的用户体验并防止状态损坏,这对生产级对话AI系统至关重要。 该方案包含两个关键点:第一,每个任务拥有独立的会话,停止操作仅中断当前运行而不清空整个对话,上下文按sessionId保存并在恢复时重新加载。第二,若工具调用在生成后、结果返回前被中断,必须插入一个恢复结果使消息链重新合法,避免出现“存在待处理工具调用但无结果”的错误。
背景
在基于LLM的Agent中,流式响应允许逐令牌发送,但用户中断可能导致对话状态不完整。工具调用是Agent请求外部操作的常见模式;若在调用中途中断,对话历史可能包含无对应结果的工具调用,破坏预期的消息结构。会话管理对于跨多次交互维护上下文至关重要。
7月31日 23:51在 X 打开#LLM Agents #Streaming #Context Management #Tool Calls #Engineering
057.0
阿里通义千问发布Qwen-Audio-3.0-ASR-Flash,增强上下文感知能力
阿里通义千问团队发布了Qwen-Audio-3.0-ASR-Flash,这是一款新的自动语音识别模型,在上下文一致性、领域术语识别和自定义热词支持方面有显著提升。该模型还提供语音润色功能,可生成结构化文本。内部测试显示,医学术语召回率达95.36%,工业术语召回率达93.24%。 该发布解决了语音识别中的一个关键挑战:准确转录专业术语并保持对话上下文。对领域特定术语的高召回率使其在医疗、制造等需要精确术语的行业中具有重要价值。这也反映了将上下文理解融入语音模型的更广泛趋势,超越了简单的声学匹配。 该模型提供两个版本:用于实时低延迟场景的Qwen-Audio-3.0-ASR-Flash-Streaming,以及用于录制语音的Qwen-Audio-3.0-ASR-Flash-Filetrans。它支持自定义热词,允许用户将识别偏向特定术语。该模型可通过阿里云模型工作室(Model Studio)使用,模型ID为fun-asr-flash-2026-06-15,在北京和新加坡区域提供API端点。尚未宣布开源权重。
背景
自动语音识别(ASR)将口语转换为文本。ASR中的上下文感知是指利用对话历史或主题等周边信息来提高准确性。热词是用户指定的术语,模型应优先识别,适用于专有名词或行话。Qwen-Audio是阿里推出的音频语言模型系列,此前涵盖声音理解和音乐分析等任务。这款新模型专注于具有增强上下文功能的语音识别。
7月31日 08:45在 X 打开#ASR #Qwen #speech recognition #AI model #Alibaba
067.0
Chops 统一管理 7 款 AI 编程工具的 Skill 文件
Chops 是一款新的开源工具,可统一管理 Claude Code、Cursor、Codex 等七款主流 AI 编程工具的 Skill 和 Agent 文件。它能自动扫描各工具的目录,并提供统一的界面来浏览、搜索和编辑这些文件。文件改动后界面会即时刷新,无需手动重新加载。 使用多个 AI 编程工具的开发者经常面临配置文件分散的问题,查找和更新特定规则非常繁琐。Chops 通过集中管理 Skill 文件解决了这一痛点,可显著简化工作流程并减少上下文切换的开销。随着 AI 编程助手生态的扩展和开发者越来越多地采用多工具组合,这款工具的价值尤为突出。 Chops 支持 Claude Code、Cursor、Codex 等七款主流 AI 编程工具,启动后会自动检测它们的 Skill 目录。它内置编辑器可直接修改文件,并提供合集功能将常用 Skill 归类,无需移动源文件。该工具已在 GitHub 上开源(仓库地址:Shpigford/chops),适合同时使用多个 AI 编程助手的开发者。
背景
Claude Code、Cursor 等 AI 编程工具允许用户通过配置文件定义自定义 Skill 或 Agent,这些文件通常存放在特定目录(如 .claude/skills/)中。Skill 可提供结构化指令、工作流或脚本,以扩展工具的功能。随着开发者使用多个此类工具,管理这些分散的 Skill 文件变得困难,往往需要手动在不同文件夹间切换。Chops 应运而生,它提供了一个统一界面来管理来自不同工具的 Skill。
8月1日 00:00在 X 打开#AI tools #developer tools #Claude Code #Cursor #Codex
077.0
ClaudeSkills:13个实用的Claude Code技能开源发布
开源项目ClaudeSkills精选了13个实用的Claude Code技能,涵盖调研、产品文档、PPT制作、长文写作、编程、安全审计、方案架构和性能优化等任务。其中调研技能会单独登记来源、逐条核对引用,并注明证据不足的结论;PPT技能则先出大纲和每页说明,确认后再渲染,并附带17套风格库和检查清单。 该合集降低了开发者使用Claude Code完成多样化实际任务的门槛,提升了生产力和产出质量。通过提供结构化、经过验证的工作流,它解决了引用准确性和演示设计等常见痛点,使AI辅助更加可靠和易用。 调研技能会明确登记来源、逐条核对引用,并标注证据不足的结论。PPT技能先生成大纲和每页说明,待用户确认后再渲染,并附带检查清单;其风格库提供17套主题。项目包含一份能力矩阵文档,帮助用户在安装前评估哪些技能适合自己。
背景
Claude Code是Anthropic推出的AI编程助手,可通过自定义技能(即模块化插件)扩展功能。技能以配置文件形式定义,并可通过GitHub仓库共享,实现社区驱动的增强。ClaudeSkills项目正是这样一组精选技能,专注于实用型非编码任务以及开发工作流。
7月31日 10:00在 X 打开#Claude Code #open source #AI tools #productivity #GitHub
087.0
My Translator:开源实时语音翻译工具
GitHub_Daily 推荐了 My Translator,这是一款开源桌面应用,能捕获系统音频或麦克风输入,并以悬浮字幕形式实时显示翻译结果。它支持四种翻译引擎,包括本地模型离线使用,并具备说话人识别功能,适用于双语对话。该工具提供 macOS 和 Windows 安装包,可直接下载使用。 对于经常观看国外模型发布会或参加国际会议的开发者和研究人员,实时翻译工具至关重要。My Translator 填补了空白,提供免费、开源的本地运行方案,无需中间服务器,保障隐私和低延迟。其自定义术语表和双栏对照功能使其适用于技术和专业场景。 该应用基于 Tauri 构建,直接从系统或麦克风捕获音频,云端引擎约两秒出结果,本地模型速度取决于设备配置。它包含双向模式,能自动识别说话人并翻译成对方语言,以及双栏对照视图,方便对比原文和译文。用户可添加自定义术语表,确保行业术语翻译一致。
背景
实时语音翻译涉及捕获音频、转写为文字、翻译文字并以最小延迟显示结果。像 My Translator 这样的开源工具利用本地处理避免将数据发送到外部服务器,从而解决隐私问题。Tauri 是一个使用 Web 技术构建轻量级桌面应用的框架,以其体积小和性能高而闻名。
7月31日 07:30在 X 打开#translation #open-source #tool #real-time #productivity
097.0
Sentinel 将旧安卓手机变成 AI 监控摄像头
一个名为 Sentinel 的 GitHub 项目将闲置的安卓手机改造成 AI 监控摄像头。它采用客户端-服务器架构,手机将视频流传输到电脑服务器,无需插件即可在浏览器中实时查看。系统支持 MP4 录制、基于传统算法的运动检测,以及可配置的视觉模型分析用于事件记录。 该项目提供了一种经济且可持续的方式重新利用旧手机,减少电子垃圾,同时提供 DIY 监控功能。它让 AI 驱动的监控变得大众化,吸引了技术爱好者和注重隐私的用户,他们更倾向于自托管方案而非商业云摄像头。 系统由安卓客户端应用和电脑端服务器组成;客户端捕获视频并发送到服务器进行处理和浏览器显示。录像按时间自动分段存为 MP4 文件,同时生成截图和日志,适合长期运行。AI 功能包括传统运动检测算法和可调节的视觉模型进行高级分析,输出事件记录。该项目开源并在 GitHub 上可用,但未详细说明具体硬件要求或性能基准。
背景
传统运动检测使用帧差法或背景减除等算法识别移动物体,而基于 AI 的视觉模型(如深度学习)可以分类物体并减少误报。将旧智能手机改造成 IP 摄像头是一种常见的 DIY 做法,利用其内置摄像头和网络连接。Sentinel 将这些概念结合成一个集成的开源监控解决方案。
7月31日 04:00在 X 打开#open-source #surveillance #AI #DIY #smartphone
106.0
国内AI厂商面临推理资源紧张,DeepSeek自研框架优势凸显
智谱AI的GLM编程套餐近期大幅涨价,Lite套餐从约49元涨至118元,而使用量不变。相比之下,DeepSeek凭借自研推理框架和国产硬件继续大幅降价。这一分化凸显了长期投资自研技术的战略优势。 这一发展凸显了推理基础设施在AI竞争格局中的关键作用。在高端GPU获取受限的情况下,中国厂商必须在软件和国产芯片上创新才能保持竞争力。DeepSeek在他人涨价时仍能降价,可能重塑市场格局,加速高性价比AI服务的普及。 GLM的Lite套餐价格从约49元涨至118元,而OpenAI同期将Luna降价80%、Terra降价20%。DeepSeek的成本优势源于其自研推理框架和对国产芯片的优化,使其能持续降价。GLM编程套餐提供GLM-5.2和GLM-5-Turbo模型,用于Claude Code、Cline等AI编程工具。
背景
中国AI公司面临美国出口管制,限制获取先进GPU,被迫依赖国产替代品。DeepSeek大力投资定制推理框架和硬件适配,降低了运营成本。GLM由智谱AI开发,是国内外市场的主要中文大语言模型之一。AI编程套餐市场正在增长,用户订阅以获取针对代码生成优化的模型。
社区讨论
原始推文和转推对GLM涨价表示不满,并与DeepSeek的降价形成对比。评论者指出,DeepSeek早期在困难的自研技术上的投入如今获得回报,而GLM因推理资源有限被迫涨价。舆论倾向于认可DeepSeek的长期战略。
7月31日 10:07在 X 打开#AI #LLM #China #pricing #inference
116.0
用 PI 或 Claude Code SDK 山寨 Codex 可打造出色 AI 编程工具
@dotey 的一条推文指出,使用 PI 或 Claude Code 的 SDK 来山寨 OpenAI 的 Codex,并搭配聪明的模型,就能打造出高质量的 AI 编程体验。作者认为大厂之所以效果不佳,是因为不愿山寨、什么都从头搭建,且只能使用自家有限的模型。 这段评论揭示了在竞争激烈的 AI 编程工具市场中,一种务实的产品策略:利用现有的 SDK 和模型可以加速开发并提升用户体验。这意味着小团队或初创公司可以通过在成熟基础上构建,而非重复造轮子,来有效竞争。 推文特别提到 PI 和 Claude Code 的 SDK 是可行的基础,并强调使用更聪明的模型至关重要。它暗示 Codex 的核心功能无需从头构建即可复制,而大公司不愿采用这种方法导致了产品效果不佳。
背景
OpenAI Codex 是集成在 ChatGPT 中的 AI 编程智能体,可帮助开发者完成拉取请求、重构和代码审查等任务。Claude Code 是 Anthropic 的终端编程工具,其 SDK 支持程序化集成。PI 是一个终端编程智能体,提供 SDK 用于构建自定义 AI 编程工具。这条推文反映了科技界常见的争论:是自研专有方案还是利用现有平台。
7月31日 05:27在 X 打开#AI coding tools #Codex #Claude Code #SDK #product strategy
125.0
开发者对比Codex、ffmpeg、HyperFrames和Remotion视频生成效果
一位开发者使用Codex,分别通过Python+ffmpeg、HyperFrames和Remotion三种方式生成相同脚本的视频。音频部分则采用了火山引擎的seed-tts-2.0。该对比展示了不同视频生成工作流的实际差异。 该对比为开发者选择自动化视频创作工具提供了实用参考。它反映了AI辅助视频生成生态的蓬勃发展,HyperFrames和Remotion等工具在传统ffmpeg脚本之上提供了更高层次的抽象。这类实验有助于社区理解灵活性、易用性和输出质量之间的权衡。 开发者首先使用Python+ffmpeg作为基线,随后用HyperFrames(通过HTML/CSS/JS渲染视频)和Remotion(基于React的视频框架)复现了相同脚本。音频统一由火山引擎的seed-tts-2.0生成,该模型支持声音复刻和文本转语音。推文中未分享性能指标或定性结果。
背景
Codex可能指OpenAI的代码生成模型,在此用于编写视频脚本。ffmpeg是一个命令行视频处理工具。HyperFrames是较新的工具,允许AI代理通过编写网页代码来合成视频,源自HeyGen。Remotion让开发者能用React以编程方式创建视频。火山引擎的seed-tts-2.0是字节跳动推出的语音合成模型,提供高质量的声音复刻和TTS功能。
7月31日 10:28在 X 打开#video generation #Codex #ffmpeg #Remotion #TTS