2026/07/31
AI研究不该从万能搜索框开始:yichen-web-research如何把证据链拆开
把搜索、已知链接读取、私人书签导出和音视频转写拆成有边界的Agent研究路由,重点看候选交接、授权闸门与可回归验证。
很多 Agent 都会“联网”,但真正做研究时,问题通常不在于能不能打开网页,而在于搜索、核验、下载、归档和后续分析有没有被清楚地分开。yichen-web-research 的价值,正是把互联网研究做成一套路由系统:先判断任务处在发现、读取、归档还是转写阶段,再交给边界明确的子 Skill。
研究入口不应该等于万能工具
仓库把能力拆成五个部分:yichen-unified-search 负责公开网页和平台搜索,yichen-content-archive 负责读取已知链接,yichen-bookmarks-export 处理经过当轮授权的私人书签导出,yichen-asr 负责已有音视频的转写,yichen-web-research 只承担多阶段任务的编排。
这个拆分看似保守,却解决了 Agent 工作流里一个很常见的越权问题:用户说“帮我找一些资料”,工具不应该顺手把搜索结果全部下载;用户给出一个链接,也不应该因为路由器喜欢“扩展研究”就开始爬作者主页、推荐列表或相似内容。搜索和归档是两个动作,发现候选和确认候选也应该是两个动作。
从搜索到证据的固定流水线
仓库给出的主流程很清楚:研究目标先进入搜索层,得到带来源和限制说明的候选清单;用户确认范围,或者原始请求已经明确指定了目标之后,才进入内容归档;需要转写时,再单独进入 ASR。它不会把一个后端包装成“什么都能做”的黑盒。
搜索层交接的不是一串标题,而是结构化候选:来源平台、原始 URL、标题、作者、时间、后端、覆盖范围和限制都应该保留下来。这样,后续写报告时可以区分“发现线索”和“已经读取并核验的原文”,也不会把搜索摘要误写成事实。
安全边界写进了路由
这个项目最值得借鉴的地方不是平台数量,而是把安全要求写成了可检查的路由契约。社交平台保持只读;不操控微信桌面端或移动端;不绕过验证码、登录墙、付费墙、限流和地区限制;不打印或保存 Cookie、Token 和 API Key;私人收藏的导出授权也不会自动转移成下载授权。
对 X 的处理尤其体现了这种思路:关键词搜索优先走官方 Grok CLI 的原生 x_search,匿名 FxTwitter 只有在明确出现账号额度耗尽证据时才作为回退;已知 X 链接则是另一条匿名读取路径。搜索和已知链接读取没有被混成一个入口。
为什么“已知链接”和“搜索”必须分开
搜索是发现行为,范围天然开放;归档是处理行为,范围应该精确。假设用户给出一个 GitHub 仓库、一个公众号文章或一条 X 帖子,归档层只读取这个已知对象,不会借机扩展到作者、相关项目或推荐内容。相反,如果用户要求“找讨论这个项目的公开文章”,这才是搜索任务,需要换到搜索层。
这种边界对内容生产尤其重要。它让文章的来源链可复查:哪些事实来自官方 README,哪些来自 release,哪些只是二手文章的说法,都能在写作前分开,而不是最后用一个“资料来源”列表掩盖证据等级差异。
验证脚本比口头约定更可靠
仓库不仅提供 Skill 文档,也提供离线验证脚本和测试。validate_family.py 会检查五个家族目录、frontmatter、Python 语法、Markdown 链接、路由边界和旧入口是否残留;带上 --doctor 后,还会进行只读的后端体检。测试会验证搜索不会自动归档、归档不会反过来执行关键词搜索、书签导出不包含下载动作,以及 X 搜索的主次路由顺序。
这说明一个成熟的研究 Skill 不应只靠更长的提示词。它需要明确的输入类型、交接格式、失败状态和可运行的回归检查。尤其在搜索后端会变化、平台接口会失效的环境里,能诚实返回“当前不可用”比生成一份看起来完整但无法追溯的报告更有价值。
适合什么场景,不适合什么场景
如果任务是“搜索多个平台,筛选候选,再读取确认后的来源并形成研究包”,这种总路由很合适。研究、竞品资料、开源项目调研、公开内容核验,都可以沿着候选—确认—归档的顺序执行。
如果只是读取一个已知 URL,直接使用内容归档子 Skill 更简单;如果只是搜关键词,直接进入统一搜索;如果是私人收藏导出或音视频转写,也应该走对应的专用入口。总路由的意义不是让所有任务都经过它,而是让多阶段任务不会在中途失去边界。
真正的产品判断
yichen-web-research 不是一个新的搜索引擎,也不是把 OpenCLI、AnySearch 或某个单一平台 CLI 换个名字。它提供的是研究工作流的控制面:决定什么时候搜索,什么时候停止扩展,什么时候等待确认,什么时候允许归档,以及失败应该如何被记录。
对 Agent 系统来说,这种“少做一步”的设计往往比多接几个后端更重要。研究结果最终要进入文章、决策或知识库;只有来源范围、授权边界和失败状态都清楚,自动化才不会把速度变成新的不确定性。