Agent Reach 教程:给 Agent 接一套可替换的互联网工具箱
Agent 想做研究,最先卡住的不是模型,而是“看不见”。网页能不能读,YouTube 字幕怎么拿,Reddit 讨论怎么搜,GitHub 信息怎么查,RSS 怎么订阅,微博客平台怎么处理登录态——这些事情分散又琐碎。 Agent Reach 把问题拆成一套互联网工具箱:网页、RSS、GitHub、YouTube/B
共 61 篇文章
Agent 想做研究,最先卡住的不是模型,而是“看不见”。网页能不能读,YouTube 字幕怎么拿,Reddit 讨论怎么搜,GitHub 信息怎么查,RSS 怎么订阅,微博客平台怎么处理登录态——这些事情分散又琐碎。 Agent Reach 把问题拆成一套互联网工具箱:网页、RSS、GitHub、YouTube/B
让 Agent 还原 Figma 设计时,最常见的做法是丢一张截图。问题是截图只能给视觉结果,给不了布局层级、间距、字体、颜色 token、frame 结构和命名。模型看得到“长这样”,但很难知道“为什么这样”。 Framelink MCP for Figma 做的是把 Figma 文件、frame 或 group 的
Agent 应用最怕“演示很好,上线就飘”。本地试十次都对,真实用户换个问法就错;工具调用在测试里正常,生产里突然走偏;你知道它失败了,却不知道失败发生在哪一步。 Future AGI 想做的是一条完整质量闭环:评测、追踪、模拟、数据集、网关、防护都放在一个平台里。它不是单点 eval 工具,而是更像 Agent 应用
把 Agent 接进 CI/CD,听起来很诱人:自动整理 issue、修小 bug、更新文档、跑评审、生成 PR。问题是,Agent 一旦进了仓库自动化链路,权限、输出和审计就不能再靠一句“相信模型”。 GitHub Agentic Workflows 的方向很值得看:用自然语言 Markdown 写 agentic
AI 编程最大的问题之一,是同一句“修这个 bug”,今天和明天可能跑出两种完全不同的过程。一次它先读测试,一次它直接改代码;一次会写计划,一次把计划省了;一次跑验证,一次嘴上说完成。 Archon 的思路很直接:不要把工程流程交给模型临场发挥,而是把计划、实现、测试、review、审批和 PR 创建写成工作流。模型负
AI 编程现在有个越来越明显的断层:代码最后进了 Git,但代码是怎么被 AI 写出来的,往往不在 Git 里。 你能看到 commit diff,能看到谁合了 PR,却很难回答几个更关键的问题:当时给 Agent 的任务是什么?它读过哪些文件?中间跑过哪些命令?为什么放弃了第一版方案?有没有把一个错误假设带进最终代码
Obscura 需要纳入评估,不是因为它喊出了“替代 Chrome”。这个说法太大,也容易误导。它更有意思的地方,是在完整浏览器和普通 HTTP 爬虫之间,挤出了一层更轻的执行底盘。 很多 AI Agent 做网页任务时,并不需要真的渲染像素。它们需要的是打开页面、跑一段 JavaScript、拿 DOM、处理 Cook
DeepSeek V4 这次降价,最值得看的不是“又便宜了”,而是便宜的位置。DeepSeek V4 Flash 的百万输入缓存命中价格,从 0.2 元降到 0.02 元;V4 Pro 的百万输入缓存命中价格,也从 1 元降到 0.1 元。
很多 AI Agent 做网页任务时,最尴尬的不是不会写代码,而是看不见真实网络。浏览器里点一下,背后跑了哪些 API、带了什么 Cookie、哪里做了签名、哪个请求失败了,Agent 往往只能靠页面结果猜。 `anything-analyzer` 把这个问题往工程侧推了一步:内嵌浏览器抓包、MITM 代理、JS Ho
AI 编程工具用久了,大家都会遇到一个问题:你明明只想让它修个登录 bug,它偏偏开始设计一套“可扩展身份系统”;你让它写一段营销文案,它先给你上价值,再给你编十个受众画像。不是模型不会干活,而是角色没定住。 `agency-agents-zh` 值得看的地方,不是“有 211 个 AI 专家角色”这个数字,而是它把角
以前聊 Playwright,重点多半落在“怎么点按钮、怎么找元素、怎么稳定跑 CI”。到了 Agent 这一步,问题其实变了:不是让 AI 多会操作浏览器,而是让它别把测试写成一锅粥。 Playwright Test Agents 有意思的地方就在这儿。它没有把“写测试”塞给一个万能 Agent,而是拆成三个角色:P
Deep Researcher Agent 火,不是因为它又包装了一个“AI 科研助手”的概念,而是它盯准了研究里最磨人的一层:实验运营。 改超参、跑训练、看日志、整理结果、再改。真正有价值的是 idea 和判断,但研究者大量时间耗在等待和机械复盘上。Deep Researcher Agent 想接过去的,正是这段重复
前端工程师转 AI Agent,最容易掉进一个坑:以为补一轮 Prompt、学会调 OpenAI API、弄懂几个 Agent 框架,就算入门了。 这只能算摸到门把手。真正把 Agent 跑进业务里,硬骨头在后面:HTTP、鉴权、任务队列、数据库、向量检索、日志、权限边界、失败重试。模型负责“想”,系统负责“能不能安全
Beads 的定位很清楚:给 Coding Agent 用的 distributed graph issue tracker,底层用 Dolt,提供结构化、可合并、可查询的任务记忆。它想替代那种越来越乱的 Markdown TODO、聊天记录计划和临时任务清单。长任务里,Agent 最容易忘的不是代码,而是“现
RTK 的定位很直接:CLI proxy,减少 LLM 在常见开发命令上的 token 消耗。它不是让模型更会写代码,而是让 Agent 别把钱和上下文窗口浪费在 `ls`、`cat`、`grep`、重复日志和巨长输出上。README 里提到在常见开发命令上能减少 60% 到 90% 的 token 消耗,这个数字先别
Oh My OpenAgent 以前叫 Oh My OpenCode,最近重新站到 Agent Harness 这个位置上。它不是一个“让界面更好看”的小插件,而是围绕 OpenCode/多 Agent CLI 的一组工作流、规则、安装方式和运行习惯。现在这类项目越来越多,真正要比的不是谁的 prompt 更唬人,而是
AI 视频剪辑这条线,过去一年有点热过头了。很多工具都在讲“一句话生成视频”“自动剪辑”“智能成片”,听起来很爽,但真正做过内容的人都知道,剪辑不是把素材丢进时间线这么简单。 难点在三处:素材怎么选,节奏怎么控,风格怎么复用。FireRed-OpenStoryline 值得看,不是因为它又把视频剪辑包装成一个聊天框,而
OpenAI 开源 Symphony,最值得看的不是它用了 Elixir,也不是它现在能不能立刻替你管完整团队。更关键的,是它把问题换了一个层级:不要再盯着 coding agent 干活,要开始管理“工作本身”。 这句话听起来有点抽象,但落到团队里很现实。Agent 越多,人工盯每个会话越不现实。未来更合理的方式
现在认真用 Coding Agent 的人,桌面上很容易堆出一把工具:Claude Code、Codex、Gemini CLI、OpenCode、OpenClaw。每个都有自己的 provider、MCP、prompt、skills、session。刚开始还新鲜,过几天就乱成一锅粥。 CC Switch 这个项目解决的
长项目里最烦人的事,不是 Claude Code 不会写代码,而是它今天记得、明天忘了;这个会话里知道,换个窗口又得从头讲。上下文窗口再大,也不是长期记忆系统。 Claude-Mem 的定位很明确:自动捕获 Claude Code 会话,把关键上下文压缩、索引,再在未来会话里按需注入。它不是把所有聊天记录硬塞回 pro