Agents API 上生产前,先把它当作 Harness 而不是 AI 员工
Agents API 把会话、编排、上下文压缩和恢复等长任务能力交给托管 harness,但它不会替团队自动完成权限、安全、观测和成本治理。本文从架构边界出发,拆解工具、子代理、沙盒、审批与上线检查。
共 20 篇文章
Agents API 把会话、编排、上下文压缩和恢复等长任务能力交给托管 harness,但它不会替团队自动完成权限、安全、观测和成本治理。本文从架构边界出发,拆解工具、子代理、沙盒、审批与上线检查。
基于 OpenContext 官方仓库与 README,解析全局 contexts 库、oc CLI、MCP、Skills 和本地 UI 如何让编程 Agent 跨会话复用工程上下文,并给出安装、初始化、验证与边界。
围绕 OpenCodex 的本地 provider proxy、Codex 路由、账户池、GUI、故障排查和安全边界,整理一份适合实操的中文长文。
Cursor 这次把 Composer 2.5 推出来,最容易被传播的说法是“性能打平 Opus,价格便宜一大截”。这话有传播力,但更值得看的是另一件事:AI Coding 工具正在把模型供应链往自己手里收。 过去 Cursor、Copilot、Cognition、OpenClaw、Claude Code 这类产品的
Tailscale 真正解决的不是“VPN 太难配”,而是今天的机器已经不再老老实实待在同一个机房里了。 一台开发机在家里,一台测试机在云上,一个 NAS 躲在运营商 NAT 后面,几台服务器散在不同厂商的 VPC,手机和笔记本还要随时接进来。传统 VPN 的默认假设是“先有一个中心网关,再把人接进去”;Tailsca
open-slide 上手:让 AI Agent 写 PPT,关键不是模板,是把幻灯片变成代码工程 PPT 这件事,最耗人的常常不是“写什么”,而是“怎么摆”。标题大一点还是小一点,图表往左还是往右,代码块会不会挤爆一页,配色有没有跑偏,改三轮之后版式还在不在。 Marp、Slidev、Reveal.js 已经把“用代
## Coding Agent 最浪费 token 的地方,往往是“找代码” 一个 Agent 改代码,最先做的通常不是写,而是找:登录逻辑在哪、配置怎么读、某个函数谁调用、测试入口是哪一个。很多工具默认做法是 grep、read、再 grep、再 read。仓库小还行,仓库一大,token 就开始哗哗流。 Sembl
视频剪辑进入 Agent 工作流以后,最容易被误解成“一句话生成视频”。真正有用的方向不是凭空生成,而是把已有素材变成可审计、可重跑的编辑流程:识别素材、切掉废话、调色、加字幕、加动画、渲染、检查边界,再输出 final.mp4。 browser-use/video-use 正是这个方向。它让 Claude Code、
终端正在被重新定义。过去它主要负责执行命令;现在,随着 Coding Agent 进入日常开发,终端开始承担上下文组织、任务分派、输出审查和远程执行入口的角色。
AI 写前端,最容易出现一种熟悉的味儿:居中的大标题,蓝紫渐变背景,三张等宽功能卡片,按钮带一点发光,下面再塞几个“Seamless / Next-Gen / Elevate”之类的词。 功能可能是对的,但一眼就知道是模型直接吐出来的。不是不能用,就是不太像一个认真做过视觉判断的产品页面。 Taste Skill 做的
Coding Agent 的 token 浪费,很多时候不是模型太贵,而是上下文太脏。终端输出、测试日志、重复文件、RAG 片段、工具结果,全都原样塞回去,模型不但花钱,还更容易被噪音带偏。 Headroom 做的是上下文优化层。它可以包装常见 coding agent,也可以作为代理放在应用和模型之间,对消息、工具输
OpenAI 模型、Codex 和 Managed Agents 进入 AWS,表面看是一次渠道扩展;往深一点看,这是 AI 云生态的一次松动。 过去两年,大模型公司和云厂商的关系很像“强绑定”:谁投钱、谁给算力、谁拿优先分发权。企业采购时也被这种绑定影响,想用某个模型,往往要进入某个云的生态。 现在 OpenAI 出
手机上写代码这件事,听起来一直有点别扭。屏幕小、键盘慢、上下文看不全,真让人把一台手机当开发机,多少有点遭罪。 `Lunel` 的有趣之处在于,它没有把手机伪装成开发机,而是把手机变成 AI Coding 的遥控台。 仓库地址:lunel-dev/lunel ## 三层架构,比远程桌面克制 Lunel 大致分三层:移动
AI 编程现在有个越来越明显的断层:代码最后进了 Git,但代码是怎么被 AI 写出来的,往往不在 Git 里。 你能看到 commit diff,能看到谁合了 PR,却很难回答几个更关键的问题:当时给 Agent 的任务是什么?它读过哪些文件?中间跑过哪些命令?为什么放弃了第一版方案?有没有把一个错误假设带进最终代码
“让 AI 帮我做事”这句话,听起来已经不新鲜了。真正麻烦的是,每次都得重新解释:这个仓库怎么跑,邮件怎么发,Issue 怎么建,PDF 怎么处理,团队规矩是什么。 Awesome Codex Skills 的价值,不是收集了一堆酷炫提示词,而是把这些重复解释,整理成 Codex 可以安装、识别、触发的技能包。 Com
Deep Researcher Agent 火,不是因为它又包装了一个“AI 科研助手”的概念,而是它盯准了研究里最磨人的一层:实验运营。 改超参、跑训练、看日志、整理结果、再改。真正有价值的是 idea 和判断,但研究者大量时间耗在等待和机械复盘上。Deep Researcher Agent 想接过去的,正是这段重复
RTK 的定位很直接:CLI proxy,减少 LLM 在常见开发命令上的 token 消耗。它不是让模型更会写代码,而是让 Agent 别把钱和上下文窗口浪费在 `ls`、`cat`、`grep`、重复日志和巨长输出上。README 里提到在常见开发命令上能减少 60% 到 90% 的 token 消耗,这个数字先别
现在认真用 Coding Agent 的人,桌面上很容易堆出一把工具:Claude Code、Codex、Gemini CLI、OpenCode、OpenClaw。每个都有自己的 provider、MCP、prompt、skills、session。刚开始还新鲜,过几天就乱成一锅粥。 CC Switch 这个项目解决的
很多人用 Codex 做页面,第一句话就是:帮我写一个后台、帮我写一个落地页、帮我做一个管理界面。 它确实能写,而且很快。但第一版经常有一种熟悉的味儿:功能都在,页面也能跑,就是像一张被组件库拼出来的表格。按钮、卡片、筛选框都有,可信息主次不清楚,用户进来不知道先看哪儿。 问题不一定在 Codex 的代码能力,而在你把