ReelOS.ai
AI News · Daily Brief

今日 AI 要闻

AI News 在时代显形之前,看见它。

overview

今日综述

今天的主线不是单个模型跑分,而是 Agent 工作流继续被工程化:网页操作被固化成 API,Harness 变成本地运行底座,ChatGPT 开始接入代码仓库并提交 PR。与此同时,开发者成本控制、可观察性和缓存命中成为高频议题,说明自动化从演示走向长期运行。

三个重点事项

  • 01Agent 工具开始沉到运行层:HAR、Harness、tmux、GitHub PR 都在把一次性操作变成可复用流程。
  • 02成本讨论更具体:企业 AI 支出、国产模型订阅、JSON 输出开销和缓存命中率都指向预算治理。
  • 03非代码场景也在补验证协议:考试题生成、浏览器数据导出和视频流程化都需要更清楚的边界。
趋势判断

未来一两周重点看 Harness、浏览器控制和代码 PR 能否出现更多真实复用案例,而不是只停留在单次演示。

风险 / 未知

本期为 72 小时补发,事实只来自入选 X 帖及其 X 补证;Shadow 未链接材料全部留作 coverage gap。

今日头条 · 2026.08.17

Hermes 将网页操作编译成可复用 API 客户端

工具 必读
Hermes 新 Skill 会把一次网页操作转成可复用 API 客户端。它通过 HAR 捕获请求并验证参数,适合让 Agent 少跑浏览器、多跑稳定 HTTP 调用。
@AISuperDomain实践者证据 · 原帖证据查看原文
判断Agent 学工具的路径正在从“模拟人点网页”转向“先探索、再固化接口”。真正的验证点是登录态、权限和网站改版后的稳定性。
证据与边界
依据
  • 原帖称该 Skill 会在真实浏览器中执行操作,并用 HAR 捕获 XHR/Fetch 请求。
  • 提取出的 URL、参数、Header 和 Body 可交给 Agent、脚本、CLI 或定时任务复用。
  • 原帖明确说它不会绕过登录、验证码或反爬,而是复用网站已有接口。
边界

只基于 Hermes 相关 X 帖;没有验证不同网站上的成功率、维护成本或服务条款风险。

内容索引
04 条
priority

重点事项 / 深读

连同头条构成今日 Top 5,保留完整判断与证据边界。

02
Agent 必读

DeepSeek Harness 开放后,Ollama 快速接入本地 Agent 运行

DeepSeek Harness 的开放开始带来生态反馈。Ollama 已支持本地运行,并加入搜索和轨迹视图,说明 Harness 正被包装成本地 Agent Runtime。
@Vincent_AINotes实践者证据 · 多源补证原文
判断开放 Harness 的价值不在单个功能,而在插件、调试和默认适配的累积。未来一两周要看更多工具是否跟进 Day 1 集成。
证据与边界
依据
  • 主帖认为 DeepSeek Harness 开放后,开发者可围绕它做插件、工具、扩展和工作流。
  • X 补证称 Ollama 已支持 `ollama launch dsh` 在本地运行 DeepSeek Harness。
  • 补证还提到 Web Search 与 Trajectory View,方便查看 Agent 调用工具和执行步骤。
边界

生态判断来自 X 观察与补证;未使用外部文档确认 Harness 路线图或 Ollama 集成细节。

补证来源@AISuperDomain
03
开源 必读

ChatGPT 可连接 GitHub 代码库并提交 PR

ChatGPT 已能在连接 GitHub 后分析仓库并提交 PR。宝玉的案例里,它先 clone 代码、给方案,再经权限确认完成实现和 PR。
@dotey实践者证据 · 单样本原文
判断代码协作正在从“生成补丁”进入“带账户权限的工作流执行”。团队需要把授权、审查和分支策略设计清楚。
证据与边界
依据
  • 原帖称 ChatGPT 收到 GitHub 地址后自行 clone 本地并分析代码。
  • 用户要求实现方案后,它基于方案完成修改并提交 PR。
  • 原帖说明需要先在 ChatGPT 设置的 Plugins 中连接 GitHub,并在操作中确认权限。
边界

这是单个用户的 ChatGPT Pro 体验;不同仓库权限、插件状态和组织策略可能影响可用性。

04
应用 商业

BaoCut 优化案例显示:少让模型吐 JSON,可明显降时延

BaoCut 的慢点来自过长 JSON 输出,而不是单纯并发不足。改造后调用次数从 33 次降到 12 次,31 分钟任务缩到 18 分钟。
@dotey实践者证据 · 单样本原文
判断Agent 优化不能只盯模型和并发,输出协议本身也会吃掉时间和 token。结构化越强,解析简单,但生成成本可能更高。
证据与边界
依据
  • 原帖称反复让 Codex/Fable 分析瓶颈后,最终发现耗时来自输出 JSON 太长。
  • 改进后调用次数从 33 次降到 12 次,任务时间从 31 分钟降到 18 分钟。
  • 原帖称近 7 小时访谈的完整润色约需 42 分钟,云模型成本估算大于 0.4 元每小时视频。
边界

数据来自 BaoCut 单个工作流;是否适用于其他字幕、转写或 Agent 管线,需要按输出格式复测。

05
开源 生态

nightmux 把终端 Agent 接到 Telegram 和 tmux

nightmux 将终端 Agent 接到 Telegram 和 tmux。它支持限额续跑、Prompt 排队、自动 compact、定时任务和移动端权限确认。
@AISuperDomain实践者证据 · 原帖证据原文
判断长任务 Agent 的痛点不只是能力,而是可观察、可接管和不中断。移动端控制会让夜间任务和远程排障更实用。
证据与边界
依据
  • 原帖称 nightmux 支持 Claude Code、Codex、Gemini、Aider 等终端 Agent。
  • 一个 Telegram Topic 对应一个 tmux Session,可查看 Git Diff、Context、Token Cost 和 Usage。
  • 原帖称 Claude Code 撞到 5 小时额度后可记录恢复时间并自动续跑。
边界

事实来自项目介绍帖;未验证安全模型、Telegram 权限边界或长时间稳定性。

08 条
signal stream

其余信号 / 速览

保持原始价值排序;展开卡片可查看判断、证据和未知边界。

06
Agent 趋势

企业 AI 支出仍在扩张,Agent 工作量可能继续吞吐 token

Aaron Levie 称企业 AI 支出仍在指数式增长。样本偏工程型公司,前 1% 每人每月约 7500 美元,Agent 工作量可能继续扩大。
@levie实践者证据 · 原帖证据原文
证据与边界
判断

成本下降不一定减少总支出,可能让企业把更多工作交给 Agent。关键验证点是 token 用量增速能否抵消单价下降。

依据
  • 原帖称工程型公司前 1% 每名员工每月 AI 支出约 7500 美元。
  • 前 10% 每名员工每月约 660 美元,但样本偏向工程中心型公司。
  • 原帖判断 token 成本下降后,安全扫描、测试、软件开发和数据处理会更多交给 Agent。
边界

这是企业支出观察,不是全市场审计数据;行业、公司规模和岗位结构会显著影响外推。

07
工具 可行动

GPT-5.6 Sol 在 Codex 中导出 5302 条 X 书签

Ethan Mollick 用 Codex 中的 GPT-5.6 Sol 接管 Chrome,导出 5302 条 X 书签。案例显示浏览器自动化可处理长期个人数据。
@emollick实践者证据 · 多源补证原文
证据与边界
判断

真实浏览器控制正在成为个人信息整理工具。风险在于登录态、隐私数据和平台规则,不能只看任务是否完成。

依据
  • 原帖称 X 不能直接导出书签,只能持续滚动查看。
  • Ethan Mollick 让 Codex 中的 GPT-5.6 Sol 接管 Chrome 完成导出。
  • 原帖称导出了从 2014 年开始的 5302 条书签及多种数据。
边界

这是个人自动化案例;X 页面变化、账户权限和数据完整性都未被独立验证。

08
Agent 趋势

o3-mini Agent 循环生成考试题,现场研究称质量接近标准化测试

一项现场研究用 o3-mini Agent 循环生成考试题。转述称题目的心理测量属性接近高风险标准化测试,但样本、科目和评分流程仍需回看原文。
@emollick实践者证据 · 原帖证据原文
证据与边界
判断

教育场景的重点会从“能否生成题目”转向“题目能否被测量学验证”。下一步要看跨学科和真实考试中的复现。

依据
  • 原帖称使用 o3-mini 放入 agentic loop 来生成考试题。
  • 转述引文称该方法在大型 AI 生成题目现场研究中表现接近高风险标准化测试题。
  • 原帖只给出研究结论摘句,没有列出完整样本和评分流程。
边界

研究细节未在 X 帖中展开;不能据此判断所有 AI 出题都达到同等质量。

09
工具 商业

实践者每月上千元采购国产 Coding 模型,作为 Codex 配额补充

一位实践者每月为国产 Coding/Agent 模型花费上千元。Codex 20x 不够用后,他用 GLM、Kimi、火山和 MiniMax 分担基础任务。
@PMbackttfuture实践者证据 · 单样本原文
证据与边界
判断

多模型订阅正在成为高频开发者的现实成本结构。产品机会在统一路由、预算控制和任务分配,而不只是哪家模型最强。

依据
  • 原帖列出 GLM V2 Pro、WorkBuddy、Kimi、火山 Agent Plan 和 MiniMax TokenPlanPlus 等订阅。
  • 发帖者称 Codex 20x 不够用后,开始用国产模型来平替基础任务。
  • 原帖称目前主力使用 GLM 5.3,其他基础任务会用 WorkBuddy、DeepSeek V4 Flash、豆包等。
边界

这是单个高频用户的购买清单;价格、套餐和可报销情况不能代表普通开发者。

10
Agent 可行动

Vibe coding 复杂系统时,先让 Agent 维护后端流程图

复杂系统 vibe-coding 时,可让 Agent 生成并维护后端流程图。代码变化后自动更新,帮助开发者在快速生成代码时仍保留流程视图。
@eptwts实践者证据 · 原帖证据原文
证据与边界
判断

AI 写代码越快,系统理解越容易掉队。把流程图变成随代码更新的产物,是一种轻量治理方法和协作记录。

依据
  • 原帖建议让 Agent 创建每个后端流程的视觉流程图。
  • 他还建议写一个 skill,在每次修改时自动更新流程图。
  • 原帖认为这能降低“AI 几分钟生成代码但人看不清”的协作成本。
边界

这是方法建议,不含量化效果;流程图是否准确仍取决于 Agent 对代码和变更的理解。

11
Agent 趋势

Latent.Space 讨论 Flue:Agent 需要 Harness,而不只是框架

Latent.Space 将 Flue 与 Vercel eve 放在同一类早期 Agent 框架里讨论。重点不是单个工具,而是 Agent 为什么需要 harness。
@latentspacepod实践者证据 · 原帖证据原文
证据与边界
判断

Agent 框架竞争会越来越像前端框架早期:抽象、运行时和开发者心智同步成形。需要看真实项目采用率。

依据
  • 原帖称 Vercel eve 和 Cloudflare Flue 都在今年发布,并形成早期模板。
  • 访谈对象 Fred K. Schott 是 Flue 创建者,也是 Astro 创建者。
  • 节目主题包括为什么 Agent 需要 harness,以及 React 如何影响 Flue 2。
边界

这是播客预告而非技术文档;具体设计取舍需要回看节目或项目资料。

12
开源 可行动

AI 视频生产工作流被拆成 7 个可复用 skills

一套 AI 视频制作流程被拆成 7 个 skills,可在 Claude Code、Codex、Hermes 等 harness 中运行。它把剧本、参考、资产和镜头提示词串起来。
@EXM7777实践者证据 · 原帖证据原文
证据与边界
判断

创作流程正在被工程化为可审计步骤。真正可迁移的不是某个提示词,而是资产锁定、压力测试和尝试记录。

依据
  • 原帖称工作流由 7 个 skills 组成,面向 Seedance 2.5。
  • 流程包括 setup、studio-init、film-breakdown、reference-board、asset-passport、stress-test 和 shot-prompt。
  • shot-prompt 会等画面内资产锁定后再写 15 块提示词,并记录每次尝试。
边界

原帖带有推广性质,未验证开源仓库质量、版权边界或不同视频模型上的复现效果。

13
观点 商业

用缓存命中解释 AI 成本:命中越高越省 token

一条中文科普用“客户报价单”解释缓存命中率。100 次请求里 80 次直接从规则拿到,就是 80% 命中率;命中越高,通常越快也越省 token。
@aronhouyu实践者证据 · 观点信号原文
证据与边界
判断

很多 Agent 成本优化最后会落到缓存和路由,而不是只换便宜模型。团队需要先识别哪些请求可复用。

依据
  • 原帖把直接从柜子拿到报价单类比为缓存命中。
  • 如果柜子里没有,就去仓库或调用模型寻找,被类比为未命中。
  • 原帖称 100 次问报价单有 80 次从规则里拿,命中率就是 80%。
边界

这是概念解释,不是系统实现方案;真实缓存还要处理权限、过期和答案一致性。