Archive

文章归档

203 篇文章,按发布时间倒序排列。

显示 203 / 203 篇文章

Vercel Zero 语言观察:Agent 时代,编译器也得会给机器读

Vercel Labs 做 Zero,表面上是又一门系统编程语言。真值得看的不是“它要不要挑战 Rust、Go、Zig”,而是另一个问题:如果代码的主要生产者、调试者、修复者越来越多地变成 Agent,编程语言和编译器该不该换一套默认设计。 Zero 的答案很直接:让能力显式,让诊断结构化,让内存和依赖可预算,让修复动

Composer 2.5:AI Coding 的账本要重算了

Cursor 这次把 Composer 2.5 推出来,最容易被传播的说法是“性能打平 Opus,价格便宜一大截”。这话有传播力,但更值得看的是另一件事:AI Coding 工具正在把模型供应链往自己手里收。 过去 Cursor、Copilot、Cognition、OpenClaw、Claude Code 这类产品的

Tailscale 上手:别再把内网访问做成一锅 VPN

Tailscale 真正解决的不是“VPN 太难配”,而是今天的机器已经不再老老实实待在同一个机房里了。 一台开发机在家里,一台测试机在云上,一个 NAS 躲在运营商 NAT 后面,几台服务器散在不同厂商的 VPC,手机和笔记本还要随时接进来。传统 VPN 的默认假设是“先有一个中心网关,再把人接进去”;Tailsca

支付宝 AI收:别只看副业,它真正补的是 Agent 交易层

支付宝把 Agent to Agent 交易摆到台前,最值得看的不是“普通人靠 AI 服务被动赚钱”这种副业叙事。 这个说法太轻,也容易把事情带偏。真正的变化在于:当 Agent 开始替人搜索、比价、下单、调用服务,支付就不能只停留在“人点按钮确认付款”的老流程里。服务要能被 Agent 发现、调用、计费、结算,还要有

Bytebot 上手:给 AI 一台能干活的电脑,而不是只给它一个聊天框

Bytebot 不是又一个“浏览器自动化插件”。它把 Agent 放进一台容器化 Linux 桌面里,让模型直接面对屏幕、文件、浏览器、办公软件和命令行。这个方向更有意思的地方,不是“说一句话让 AI 点鼠标”这么热闹,而是 Agent 的运行环境开始从聊天框,往一台可隔离、可观察、可接管、可持久化的工作站迁移。 这

open-slide 上手:让 AI Agent 写 PPT,关键不是模板,是把幻灯片变成代码工程

open-slide 上手:让 AI Agent 写 PPT,关键不是模板,是把幻灯片变成代码工程 PPT 这件事,最耗人的常常不是“写什么”,而是“怎么摆”。标题大一点还是小一点,图表往左还是往右,代码块会不会挤爆一页,配色有没有跑偏,改三轮之后版式还在不在。 Marp、Slidev、Reveal.js 已经把“用代

Yazi 上手:把终端文件管理做成一个键盘驾驶舱

终端文件管理器这类工具,很容易被写成“ls 和 cd 的升级版”。这说法没错,但有点浅。 Yazi 更关键的地方,不只是它能在终端里预览图片、PDF、压缩包和代码,而是它把“文件浏览”这件事重新放回了键盘工作流里。对开发者、运维、远程服务器用户来说,文件管理不是打开一个 Finder 或资源管理器那么简单:你经常在

bux 上手:把 Claude Code 变成 24 小时在线的浏览器 Agent

把 Claude Code 装在自己电脑上,适合“坐在桌前写代码”。但真正想让 Agent 干活,问题很快就变成另一种:人不在电脑前怎么办?浏览器登录态怎么保留?任务跑到一半遇到 2FA 或验证码怎么办?手机上能不能只发一句话,让它继续处理? bux 解决的正是这个缝隙。它不是另一个浏览器自动化框架,也不是给 Clau

Recordly 上手:开源录屏工具真正要替掉的,是演示视频的后期碎活

产品演示视频最烦人的地方,不是录屏。录屏只是一秒钟按下按钮。真正花时间的是后面那串碎活:哪里该放大,光标要不要美化,背景怎么包装,要不要加字幕,GIF 和 MP4 分别怎么导出,录完看起来会不会像临时糊弄出来的素材。 Recordly 这类开源工具需要纳入评估,不是因为它“免费平替 Screen Studio”。免费只是入

Software 3.0 来了:程序员真正要学的不是 Prompt,而是给 Agent 设计接口

Karpathy 把 Software 3.0 说清楚之后,很多人第一反应还是落在“以后是不是不用写代码了”。这个问题问得太早,也太浅。更值得看的是:软件的接口正在换人。 Software 1.0 的接口给程序员用,核心是编程语言、函数、类型、测试和部署。Software 2.0 的接口给训练系统用,核心是数据集、损

Semble 上手:给 Coding Agent 一套省 token 的代码搜索层

## Coding Agent 最浪费 token 的地方,往往是“找代码” 一个 Agent 改代码,最先做的通常不是写,而是找:登录逻辑在哪、配置怎么读、某个函数谁调用、测试入口是哪一个。很多工具默认做法是 grep、read、再 grep、再 read。仓库小还行,仓库一大,token 就开始哗哗流。 Sembl

thClaws 上手:用 Rust 做一个主权 Agent 工作台

## Agent 工作台开始往“一个二进制”收拢 现在的 AI 编程工具有点分裂:一个 CLI 负责聊天,一个编辑器插件负责改文件,一个 Web UI 负责看会话,一个脚本负责跑自动化。工具越多,能力越强,但状态也越散。你要换机器、换模型、换工作目录时,就会发现很多上下文其实不在项目里,而是黏在某个客户端上。 thCl

World2Agent 上手:让 Agent 先看见世界,再谈自动行动

## Agent 如果看不见世界,就只能在上下文里瞎猜 很多 Agent 项目聊到最后,都会卡在同一个地方:模型会推理、会写代码、会调用工具,但它对外部世界的感知仍然很碎。新闻、市场、日志、告警、天气、发布动态、GitHub 事件,各走各的格式,各写各的接入。Agent 想行动之前,先得靠一堆临时 glue code

video-use 上手:让 Coding Agent 真的剪出 final.mp4

视频剪辑进入 Agent 工作流以后,最容易被误解成“一句话生成视频”。真正有用的方向不是凭空生成,而是把已有素材变成可审计、可重跑的编辑流程:识别素材、切掉废话、调色、加字幕、加动画、渲染、检查边界,再输出 final.mp4。 browser-use/video-use 正是这个方向。它让 Claude Code、

apfel 上手:把 Mac 自带 Apple Intelligence 变成本地 OpenAI 接口

很多本地模型方案都绕不开下载模型、选量化、配显存、调推理服务。Mac 用户还有另一条路:把系统自带的 Apple Intelligence 变成命令行工具和本地 OpenAI 兼容接口。apfel 做的就是这件事。 它把 Apple FoundationModels 暴露成 UNIX CLI、交互式聊天和本地 Open

OfficeCLI 上手:让 Agent 读写 Word、Excel、PPT,不再依赖 Office 桌面

Office 自动化一直是 Agent 的尴尬区。企业文件大量存在 Word、Excel、PowerPoint 里,但传统自动化要么依赖桌面 Office,要么用几套库分别处理 docx、xlsx、pptx,结构不统一,预览也麻烦。Agent 想稳定修改这些文件,不能只靠“生成一段 Python 试试”。 Office

OpenHarness 上手:把 Agent 从聊天框推进到可恢复的长期工作台

Agent 真正进入日常工作以后,瓶颈往往不在模型本身,而在运行时。聊天框能回答问题,但很难长期维护一个项目:它要记住上下文、调用工具、拆任务、写代码、跑测试、处理失败、接消息平台,还要能在长会话里恢复状态。 OpenHarness 把这个问题直接摆到了台面上。它不是另一个“套壳聊天助手”,而是一套轻量 Agent h

Ubuntu 防火墙从入门到精通:UFW、nftables、Docker 和生产环境排错

Ubuntu 上的防火墙不难,难的是很多人一开始就把它想歪了:不是背几条 `ufw allow`,也不是把所有端口一关就叫安全。真正能长期维护的防火墙配置,应该回答三个问题:这台机器对外提供什么服务、谁能访问、出了问题怎么安全回滚。 Ubuntu 默认推荐的入口是 UFW,也就是 Uncomplicated Firew

Warp 上手:把终端升级成 Agent 开发工作台

终端正在被重新定义。过去它主要负责执行命令;现在,随着 Coding Agent 进入日常开发,终端开始承担上下文组织、任务分派、输出审查和远程执行入口的角色。

Taste Skill 上手:别让 AI 前端只会紫色渐变和三张卡片

AI 写前端,最容易出现一种熟悉的味儿:居中的大标题,蓝紫渐变背景,三张等宽功能卡片,按钮带一点发光,下面再塞几个“Seamless / Next-Gen / Elevate”之类的词。 功能可能是对的,但一眼就知道是模型直接吐出来的。不是不能用,就是不太像一个认真做过视觉判断的产品页面。 Taste Skill 做的

Agent Zero 上手:别把它当聊天框,它更像一台 Agent 工作台

Agent Zero 这类项目,最容易被写成“又一个自主 Agent 框架”。这话不能算错,但没抓到重点。 它更关键的地方,不是会聊天,也不是会调用几个工具,而是把 Agent 放进一台完整的 Linux 工作台里:有文件系统,有终端,有浏览器,有记忆,有项目隔离,有插件和技能,还能把任务继续拆给子 Agent。

UncommonRoute 教程:给 LLM 请求加一层自动路由,先把便宜模型用明白

大模型成本控制最常见的错误,是只盯单价。单价当然重要,但真正烧钱的,是简单任务也走最贵模型,失败重试又继续走最贵模型,最后账单一看,像开了水龙头。 UncommonRoute 的思路是加一层自动路由。它作为 OpenAI 兼容代理,帮你判断请求复杂度,把简单任务交给便宜模型,把复杂任务交给更强模型。项目强调最高可以节省

InkOS 教程:让小说 Agent 会写、会审、会改,还得能被人拽住

AI 写小说最常见的失败,不是写不出字,而是写着写着就散了。人物性格漂,节奏乱,前后设定打架,越到后面越像自动续杯的套路汤。 InkOS 值得看的地方,是它没有把自己包装成一个“输入一句话生成百万字”的玩具,而是把小说创作拆成写、审、改、人工审核几个环节。它是一个自动化小说写作 Agent,也发布成 OpenClaw

Hive 教程:给多 Agent 任务补上 Harness,而不是再写一条链

很多多 Agent 项目看起来都挺热闹:一个规划,一个执行,一个检查,再来一个总结。演示的时候顺滑,真塞进业务流程,麻烦就来了。中途失败怎么办?状态丢了怎么办?两个 Agent 写冲突了怎么办?谁来判断它该停手? Hive 的切口不是再做一个花哨 Agent,而是做 harness。也就是给多 Agent 任务补上状态

Coze Loop 教程:Agent 上线前,先把评测、Prompt 和监控闭环补上

Agent 项目最常见的事故,是上线前靠感觉调 prompt,上线后靠用户投诉发现问题。模型换了、工具改了、知识库更新了,没人知道效果从哪天开始变差。 Coze Loop 是面向 AI Agent 优化的平台,覆盖开发、调试、评测、Prompt 管理和线上监控。它的价值不是多一个控制台,而是让 Agent 的质量变化能

Banana Slides 教程:用 AI 做可编辑 PPT,先管模板、素材和复核

AI 做 PPT 最大的问题,不是能不能生成页面,而是生成出来能不能继续改。很多工具输出一堆图片,看着还行,到了客户修改、老板改字、设计调版时就废了。 Banana Slides 押的是另一条路:上传模板图片和素材,让 AI 解析内容,按自然语言生成或修改页面,并导出可编辑 PPTX。它更像一个 AI PPT 工作台,

Headroom 教程:给 Coding Agent 加一层上下文压缩,少花 token 还要不掉准

Coding Agent 的 token 浪费,很多时候不是模型太贵,而是上下文太脏。终端输出、测试日志、重复文件、RAG 片段、工具结果,全都原样塞回去,模型不但花钱,还更容易被噪音带偏。 Headroom 做的是上下文优化层。它可以包装常见 coding agent,也可以作为代理放在应用和模型之间,对消息、工具输

MOSS-TTS 教程:自托管语音生成,先把延迟、显存和授权边界讲清楚

语音 AI 的 demo 通常都很好听。真正落地时,问题才冒出来:长文本断句不自然,显存吃紧,首包延迟高,声音克隆授权不清楚,多说几分钟后情绪和音色开始飘。 MOSS-TTS 是开源语音生成模型家族,覆盖长文本语音、多说话人对话、声音设计、环境声和实时流式等方向。它适合想把 TTS 放到本地或自托管环境里的团队。 但语

Chandra OCR 教程:复杂 PDF 进 RAG 前,先把版面和表格处理干净

做 RAG 时,很多人把注意力放在向量库和模型上,却忽略了最前面的文档解析。PDF 里的表格错位、公式断掉、页眉页脚混进正文,后面检索再强也救不回来。 Chandra OCR 适合处理这类硬文档:复杂表格、表单、手写、多语言、数学公式、版面结构。它能把文档转成 Markdown、HTML 或 JSON,并保留更详细的

TOON 教程:把 JSON 数据喂给模型前,先把 token 账算明白

很多人做 AI 应用时,第一反应是把业务数据直接塞成 JSON。简单、通用、模型也能读,看起来没毛病。 但一到真实场景,账就不太对了。订单列表、埋点日志、知识库片段、搜索结果、用户画像、商品属性,全都用 JSON 喂给模型,会浪费大量字段名、括号和重复结构。上下文窗口再大,也不能这么霍霍。 TOON 的价值就在这里。它

IBM Granite 4.1:小模型路线没输,输的是粗糙训练

IBM Granite 4.1 的发布,很适合给开源模型圈泼一点冷静水:小模型路线没有输,输的是粗糙训练和粗糙定位。 Granite 4.1 是 3B、8B、30B 的 dense decoder-only 模型家族,训练管线包含约 15T tokens、多阶段预训练、长上下文扩展、监督微调和多阶段强化学习。更关键的是

Google 第八代 TPU 分成两条线:Agent 时代的算力不再只拼大

Google 第八代 TPU 分成 8T 和 8I 两条线,这件事比单纯“新芯片更强”有意思。 过去讨论 AI 算力,大家很容易只看峰值、参数、集群规模。到了 Agent 时代,负载变复杂了:有长时间训练,有大规模推理,有低延迟交互,有多轮工具调用,还有大量上下文读写。所有任务都用同一种算力形态硬扛,成本会很难看。 #

OpenAI 上 AWS:模型独家时代开始松动了

OpenAI 模型、Codex 和 Managed Agents 进入 AWS,表面看是一次渠道扩展;往深一点看,这是 AI 云生态的一次松动。 过去两年,大模型公司和云厂商的关系很像“强绑定”:谁投钱、谁给算力、谁拿优先分发权。企业采购时也被这种绑定影响,想用某个模型,往往要进入某个云的生态。 现在 OpenAI 出

Sentrux:AI 写代码不能只看 diff,还要有架构传感器

AI Agent 写代码最容易让人上头。头几天,功能像开闸一样往外冒;再过几天,项目里开始出现幻觉函数、错位依赖、循环引用、God 文件。不是模型突然变笨了,而是代码库本身开始失去结构。 Sentrux 值得看的地方,不是又多了一个静态分析工具,而是它试图给 Coding Agent 补一个反馈器官:在 Agent 动

YourMemory:Agent 记忆不是越多越好,还要会遗忘

Agent 记忆经常被说成“越多越好”。这话只对了一半。记得越多,确实更像一个长期助手;但如果旧事实、错误偏好、过期项目状态一直留着,Agent 也会被记忆带偏。 `YourMemory` 有意思的地方,是它把“遗忘”也放进了 Agent 记忆系统。 仓库地址:sachitrafa/YourMemory ## 记忆不是

Databricks AI Dev Kit:让 Coding Agent 真懂你的湖仓平台

让 Coding Agent 写普通 Web 代码已经不新鲜了。难的是让它进入一个复杂数据平台:Spark、Unity Catalog、Jobs、MLflow、Model Serving、权限、表结构、流水线规范全都在场。 `Databricks AI Dev Kit` 解决的是这个问题:给 Claude Code、C

Xyne:企业搜索别再让 Agent 翻聊天记录

企业里最浪费时间的动作,可能是找东西。文件在 Drive,决策在 Slack,需求在 Jira,线索在邮件,代码在 GitHub,最后每个人脑子里还有一份“只有我知道”的隐性地图。 `Xyne` 盯上的正是这个问题:给工作场景做一个开源的 AI 搜索与问答引擎。 仓库地址:xynehq/xyne ## 它不是普通知识库

Vibe Coding 冲进原型设计,设计师真正该守住的是判断

Vibe Coding 正在把原型设计这件事压得很扁。 以前一个交互原型,可能要设计师画半天、调两天、改三轮。现在你对着 Figma Make、Framer AI、Google Stitch 或类似工具说几句话,一个能点、能跳、能演示的版本就出来了。别管它是不是最终稿,至少老板、产品、开发都能先看见东西。 这对原型设计

Lunel:手机不是跑代码的机器,而是 AI Coding 的遥控台

手机上写代码这件事,听起来一直有点别扭。屏幕小、键盘慢、上下文看不全,真让人把一台手机当开发机,多少有点遭罪。 `Lunel` 的有趣之处在于,它没有把手机伪装成开发机,而是把手机变成 AI Coding 的遥控台。 仓库地址:lunel-dev/lunel ## 三层架构,比远程桌面克制 Lunel 大致分三层:移动

小米 MiMo 发 Token:更关键的是测的是国产模型的 Agent 耐力

小米 MiMo-V2.5 系列开源之后,又给开发者放了一波更直接的东西:MiMo Orbit Token 激励。表面看,这是一次免费额度活动;往深一点看,这是国产模型主动争取 AI builder 的一次入口战。 别把它只理解成“薅点 Token”。如果只是领完额度、跑几个聊天问题、截个图发朋友圈,那这波额度基本就浪费

VoltAgent 教程:用 TypeScript 把 Agent 写成可观测工程服务

TypeScript 团队做 Agent,常见路线是从前端或 Node 服务里拼一个聊天 demo:接模型、写工具、加一点 memory,再接到页面。能演示,但上线后很快缺东西:trace 看不见,工具失败不好查,RAG 数据难管,guardrail 没地方放,部署也像临时脚本。 VoltAgent 想把这条路工程化:

Agent Reach 教程:给 Agent 接一套可替换的互联网工具箱

Agent 想做研究,最先卡住的不是模型,而是“看不见”。网页能不能读,YouTube 字幕怎么拿,Reddit 讨论怎么搜,GitHub 信息怎么查,RSS 怎么订阅,微博客平台怎么处理登录态——这些事情分散又琐碎。 Agent Reach 把问题拆成一套互联网工具箱:网页、RSS、GitHub、YouTube/B

Framelink Figma MCP 教程:别再给 Agent 只丢截图

让 Agent 还原 Figma 设计时,最常见的做法是丢一张截图。问题是截图只能给视觉结果,给不了布局层级、间距、字体、颜色 token、frame 结构和命名。模型看得到“长这样”,但很难知道“为什么这样”。 Framelink MCP for Figma 做的是把 Figma 文件、frame 或 group 的

gstack 教程:把 Claude Code 变成一支会复盘的产品小队

很多人用 Claude Code,习惯是把需求直接扔进去,然后盯着它改。能跑,效率也有,但问题很快出现:产品判断没人做,设计味道没人看,安全审计靠运气,最后发布时再补文档和测试。AI 写代码变快了,工程流程反而容易被省掉。 gstack 值得看的地方,不在“Garry Tan 的同款配置”这个噱头,而在它把 Claud

Future AGI 教程:把 Agent 评测、追踪和防护放进同一个闭环

Agent 应用最怕“演示很好,上线就飘”。本地试十次都对,真实用户换个问法就错;工具调用在测试里正常,生产里突然走偏;你知道它失败了,却不知道失败发生在哪一步。 Future AGI 想做的是一条完整质量闭环:评测、追踪、模拟、数据集、网关、防护都放在一个平台里。它不是单点 eval 工具,而是更像 Agent 应用

GitHub Agentic Workflows 教程:把 Agent 放进 Actions,但先管住权限

把 Agent 接进 CI/CD,听起来很诱人:自动整理 issue、修小 bug、更新文档、跑评审、生成 PR。问题是,Agent 一旦进了仓库自动化链路,权限、输出和审计就不能再靠一句“相信模型”。 GitHub Agentic Workflows 的方向很值得看:用自然语言 Markdown 写 agentic

Archon 教程:把 AI 编程流程写成可重复的工作流

AI 编程最大的问题之一,是同一句“修这个 bug”,今天和明天可能跑出两种完全不同的过程。一次它先读测试,一次它直接改代码;一次会写计划,一次把计划省了;一次跑验证,一次嘴上说完成。 Archon 的思路很直接:不要把工程流程交给模型临场发挥,而是把计划、实现、测试、review、审批和 PR 创建写成工作流。模型负

Entire CLI:AI 写代码,也该留下可追溯的工程账本

AI 编程现在有个越来越明显的断层:代码最后进了 Git,但代码是怎么被 AI 写出来的,往往不在 Git 里。 你能看到 commit diff,能看到谁合了 PR,却很难回答几个更关键的问题:当时给 Agent 的任务是什么?它读过哪些文件?中间跑过哪些命令?为什么放弃了第一版方案?有没有把一个错误假设带进最终代码

用 tempmail.ee 注册 GitHub:先试用,再把主邮箱留给真正重要的账号

GitHub 是典型的代码托管和开发者协作平台:不注册,很多功能看不完整;一注册,又可能开始收到确认邮件、提醒、营销信息和各种后续通知。只想先试一下时,tempmail.ee 可以当作临时邮箱缓冲层。 要先把边界说清楚。临时邮箱不是绕过平台规则的工具,也不该用于刷号、规避封禁、垃圾信息或冒充身份。它只适合低风险试用:先

用 tempmail.ee 注册 Hugging Face:先试用,再决定要不要交出主邮箱

Hugging Face 这类AI 模型和数据社区,通常会把账号注册放在使用体验前面。你想先看看功能、试一条流程、确认它值不值得长期使用,却不一定想马上交出主邮箱。这个场景里,tempmail.ee 适合当一层临时缓冲:先收确认邮件,再决定要不要换成长期邮箱。 这不是“绕过规则”的玩法。临时邮箱只能解决收邮件这件小事,

用 tempmail.ee 注册 Quora:先试用,再决定要不要交出主邮箱

Quora 这类问答社区,通常会把账号注册放在使用体验前面。你想先看看功能、试一条流程、确认它值不值得长期使用,却不一定想马上交出主邮箱。这个场景里,tempmail.ee 适合当一层临时缓冲:先收确认邮件,再决定要不要换成长期邮箱。 这不是“绕过规则”的玩法。临时邮箱只能解决收邮件这件小事,不能替你通过额外安全验证,

用 tempmail.ee 注册 Figma:先试用,再决定要不要交出主邮箱

Figma 这类协作设计工具,通常会把账号注册放在使用体验前面。你想先看看功能、试一条流程、确认它值不值得长期使用,却不一定想马上交出主邮箱。这个场景里,tempmail.ee 适合当一层临时缓冲:先收确认邮件,再决定要不要换成长期邮箱。 这不是“绕过规则”的玩法。临时邮箱只能解决收邮件这件小事,不能替你通过额外安全验

注册 ChatGPT 时用 tempmail.ee:临时邮箱能解决什么,不能解决什么

注册 ChatGPT 时,有些人不想一上来就把主邮箱交出去:怕营销邮件、怕测试账号污染工作邮箱,也怕一次性试用之后留下长尾垃圾信息。这个场景里,tempmail.ee 这种临时邮箱工具就有用武之地。 但话先说在前面:临时邮箱不是“保证注册成功”的捷径,更不是用来绕过平台规则、批量开号或规避风控的工具。OpenAI /

测试工程师别只学 Prompt:Skills 才是 AI 测试流程的复用层

测试工程师用 AI,最容易从 Prompt 入门:让它写用例、整理缺陷、生成报告。短期看很爽,长期看会遇到一个问题:每次都要重新解释上下文、格式、字段、边界和输出要求。人累,模型也容易跑偏。 Skills 的意义就在这里。它不是一段更长的提示词,而是把一套稳定测试方法封装成可复用能力。下次遇到同类任务,不必从零写要求,

Awesome Codex Skills:Codex 真要进工作流,靠的不是神提示词,是可安装技能

“让 AI 帮我做事”这句话,听起来已经不新鲜了。真正麻烦的是,每次都得重新解释:这个仓库怎么跑,邮件怎么发,Issue 怎么建,PDF 怎么处理,团队规矩是什么。 Awesome Codex Skills 的价值,不是收集了一堆酷炫提示词,而是把这些重复解释,整理成 Codex 可以安装、识别、触发的技能包。 Com

用 AI 做 MoSCoW:需求排序不是让模型拍板,是先把争论结构化

需求优先级最烦人的地方,不是没有方法论,而是每个人都能拿方法论替自己说话。 业务说用户等不了,技术说这块顺手,老板说先做能卖钱的,产品经理夹在中间,最后会议开了两小时,只得到一张谁都不太服的列表。 用 AI 做 MoSCoW 评分,真正有用的地方不在“让模型决定做什么”,而是把一团情绪和口头判断,先压成一张能讨论、能复

anything-analyzer 教程:给 Agent 一套网络观察台,而不是让它盲猜接口

很多 AI Agent 做网页任务时,最尴尬的不是不会写代码,而是看不见真实网络。浏览器里点一下,背后跑了哪些 API、带了什么 Cookie、哪里做了签名、哪个请求失败了,Agent 往往只能靠页面结果猜。 `anything-analyzer` 把这个问题往工程侧推了一步:内嵌浏览器抓包、MITM 代理、JS Ho

agency-agents-zh 教程:211 个专家角色,不是提示词合集,是 Agent 分工手册

AI 编程工具用久了,大家都会遇到一个问题:你明明只想让它修个登录 bug,它偏偏开始设计一套“可扩展身份系统”;你让它写一段营销文案,它先给你上价值,再给你编十个受众画像。不是模型不会干活,而是角色没定住。 `agency-agents-zh` 值得看的地方,不是“有 211 个 AI 专家角色”这个数字,而是它把角

Playwright Test Agents 上手:测试自动化从写脚本,变成审核计划

以前聊 Playwright,重点多半落在“怎么点按钮、怎么找元素、怎么稳定跑 CI”。到了 Agent 这一步,问题其实变了:不是让 AI 多会操作浏览器,而是让它别把测试写成一锅粥。 Playwright Test Agents 有意思的地方就在这儿。它没有把“写测试”塞给一个万能 Agent,而是拆成三个角色:P

Deep Researcher Agent 教程:让 AI 替你盯训练,但别把科学判断也外包

Deep Researcher Agent 火,不是因为它又包装了一个“AI 科研助手”的概念,而是它盯准了研究里最磨人的一层:实验运营。 改超参、跑训练、看日志、整理结果、再改。真正有价值的是 idea 和判断,但研究者大量时间耗在等待和机械复盘上。Deep Researcher Agent 想接过去的,正是这段重复

前端转 AI Agent 工程师,别只补 LLM:后端、RAG、权限和队列才是硬骨头

前端工程师转 AI Agent,最容易掉进一个坑:以为补一轮 Prompt、学会调 OpenAI API、弄懂几个 Agent 框架,就算入门了。 这只能算摸到门把手。真正把 Agent 跑进业务里,硬骨头在后面:HTTP、鉴权、任务队列、数据库、向量检索、日志、权限边界、失败重试。模型负责“想”,系统负责“能不能安全

RTK 上手:别让 Coding Agent 把 token 烧在 ls、cat 和重复命令上

RTK 的定位很直接:CLI proxy,减少 LLM 在常见开发命令上的 token 消耗。它不是让模型更会写代码,而是让 Agent 别把钱和上下文窗口浪费在 `ls`、`cat`、`grep`、重复日志和巨长输出上。README 里提到在常见开发命令上能减少 60% 到 90% 的 token 消耗,这个数字先别

Oh My OpenAgent 上手:给 OpenCode 系工具加一层可维护的 Agent Harness

Oh My OpenAgent 以前叫 Oh My OpenCode,最近重新站到 Agent Harness 这个位置上。它不是一个“让界面更好看”的小插件,而是围绕 OpenCode/多 Agent CLI 的一组工作流、规则、安装方式和运行习惯。现在这类项目越来越多,真正要比的不是谁的 prompt 更唬人,而是

FireRed-OpenStoryline 教程:AI 剪视频,真正值钱的是把风格沉淀成 Skill

AI 视频剪辑这条线,过去一年有点热过头了。很多工具都在讲“一句话生成视频”“自动剪辑”“智能成片”,听起来很爽,但真正做过内容的人都知道,剪辑不是把素材丢进时间线这么简单。 难点在三处:素材怎么选,节奏怎么控,风格怎么复用。FireRed-OpenStoryline 值得看,不是因为它又把视频剪辑包装成一个聊天框,而

OpenAI Symphony 入门:别再盯着 Agent 干活,开始管理任务队列

OpenAI 开源 Symphony,最值得看的不是它用了 Elixir,也不是它现在能不能立刻替你管完整团队。更关键的,是它把问题换了一个层级:不要再盯着 coding agent 干活,要开始管理“工作本身”。 这句话听起来有点抽象,但落到团队里很现实。Agent 越多,人工盯每个会话越不现实。未来更合理的方式

Claude-Mem 教程:给 Claude Code 接一层能搜索的长期记忆

长项目里最烦人的事,不是 Claude Code 不会写代码,而是它今天记得、明天忘了;这个会话里知道,换个窗口又得从头讲。上下文窗口再大,也不是长期记忆系统。 Claude-Mem 的定位很明确:自动捕获 Claude Code 会话,把关键上下文压缩、索引,再在未来会话里按需注入。它不是把所有聊天记录硬塞回 pro

别让 Codex 直接写页面:先把 UI 生产线拆成三段

很多人用 Codex 做页面,第一句话就是:帮我写一个后台、帮我写一个落地页、帮我做一个管理界面。 它确实能写,而且很快。但第一版经常有一种熟悉的味儿:功能都在,页面也能跑,就是像一张被组件库拼出来的表格。按钮、卡片、筛选框都有,可信息主次不清楚,用户进来不知道先看哪儿。 问题不一定在 Codex 的代码能力,而在你把

吴恩达说的不是 PM 消失,而是产品判断成了新瓶颈

AI 编程工具把代码写快以后,很多团队才发现,真正拖慢项目的不是 IDE,也不是框架,而是“到底该做什么”。 吴恩达在 The Batch 里讲的这个判断,表面看是在说工程师和产品经理的关系,往深了看,其实是在说软件团队的瓶颈迁移:当实现成本快速下降,产品判断、跨部门协同、发布节奏和风险把关,会一下子变得更贵。 ##