首页 / 标签

#Agent

61 篇文章

OpenHarness 上手:把 Agent 从聊天框推进到可恢复的长期工作台

Agent 真正进入日常工作以后,瓶颈往往不在模型本身,而在运行时。聊天框能回答问题,但很难长期维护一个项目:它要记住上下文、调用工具、拆任务、写代码、跑测试、处理失败、接消息平台,还要能在长会话里恢复状态。 OpenHarness 把这个问题直接摆到了台面上。它不是另一个“套壳聊天助手”,而是一套轻量 Agent h

3 min

Taste Skill 上手:别让 AI 前端只会紫色渐变和三张卡片

AI 写前端,最容易出现一种熟悉的味儿:居中的大标题,蓝紫渐变背景,三张等宽功能卡片,按钮带一点发光,下面再塞几个“Seamless / Next-Gen / Elevate”之类的词。 功能可能是对的,但一眼就知道是模型直接吐出来的。不是不能用,就是不太像一个认真做过视觉判断的产品页面。 Taste Skill 做的

3 min

Agent Zero 上手:别把它当聊天框,它更像一台 Agent 工作台

Agent Zero 这类项目,最容易被写成“又一个自主 Agent 框架”。这话不能算错,但没抓到重点。 它更关键的地方,不是会聊天,也不是会调用几个工具,而是把 Agent 放进一台完整的 Linux 工作台里:有文件系统,有终端,有浏览器,有记忆,有项目隔离,有插件和技能,还能把任务继续拆给子 Agent。

3 min

InkOS 教程:让小说 Agent 会写、会审、会改,还得能被人拽住

AI 写小说最常见的失败,不是写不出字,而是写着写着就散了。人物性格漂,节奏乱,前后设定打架,越到后面越像自动续杯的套路汤。 InkOS 值得看的地方,是它没有把自己包装成一个“输入一句话生成百万字”的玩具,而是把小说创作拆成写、审、改、人工审核几个环节。它是一个自动化小说写作 Agent,也发布成 OpenClaw

3 min

Hive 教程:给多 Agent 任务补上 Harness,而不是再写一条链

很多多 Agent 项目看起来都挺热闹:一个规划,一个执行,一个检查,再来一个总结。演示的时候顺滑,真塞进业务流程,麻烦就来了。中途失败怎么办?状态丢了怎么办?两个 Agent 写冲突了怎么办?谁来判断它该停手? Hive 的切口不是再做一个花哨 Agent,而是做 harness。也就是给多 Agent 任务补上状态

3 min

Coze Loop 教程:Agent 上线前,先把评测、Prompt 和监控闭环补上

Agent 项目最常见的事故,是上线前靠感觉调 prompt,上线后靠用户投诉发现问题。模型换了、工具改了、知识库更新了,没人知道效果从哪天开始变差。 Coze Loop 是面向 AI Agent 优化的平台,覆盖开发、调试、评测、Prompt 管理和线上监控。它的价值不是多一个控制台,而是让 Agent 的质量变化能

3 min

Headroom 教程:给 Coding Agent 加一层上下文压缩,少花 token 还要不掉准

Coding Agent 的 token 浪费,很多时候不是模型太贵,而是上下文太脏。终端输出、测试日志、重复文件、RAG 片段、工具结果,全都原样塞回去,模型不但花钱,还更容易被噪音带偏。 Headroom 做的是上下文优化层。它可以包装常见 coding agent,也可以作为代理放在应用和模型之间,对消息、工具输

3 min

TOON 教程:把 JSON 数据喂给模型前,先把 token 账算明白

很多人做 AI 应用时,第一反应是把业务数据直接塞成 JSON。简单、通用、模型也能读,看起来没毛病。 但一到真实场景,账就不太对了。订单列表、埋点日志、知识库片段、搜索结果、用户画像、商品属性,全都用 JSON 喂给模型,会浪费大量字段名、括号和重复结构。上下文窗口再大,也不能这么霍霍。 TOON 的价值就在这里。它

3 min

Google 第八代 TPU 分成两条线:Agent 时代的算力不再只拼大

Google 第八代 TPU 分成 8T 和 8I 两条线,这件事比单纯“新芯片更强”有意思。 过去讨论 AI 算力,大家很容易只看峰值、参数、集群规模。到了 Agent 时代,负载变复杂了:有长时间训练,有大规模推理,有低延迟交互,有多轮工具调用,还有大量上下文读写。所有任务都用同一种算力形态硬扛,成本会很难看。 #

3 min

OpenAI 上 AWS:模型独家时代开始松动了

OpenAI 模型、Codex 和 Managed Agents 进入 AWS,表面看是一次渠道扩展;往深一点看,这是 AI 云生态的一次松动。 过去两年,大模型公司和云厂商的关系很像“强绑定”:谁投钱、谁给算力、谁拿优先分发权。企业采购时也被这种绑定影响,想用某个模型,往往要进入某个云的生态。 现在 OpenAI 出

3 min

Sentrux:AI 写代码不能只看 diff,还要有架构传感器

AI Agent 写代码最容易让人上头。头几天,功能像开闸一样往外冒;再过几天,项目里开始出现幻觉函数、错位依赖、循环引用、God 文件。不是模型突然变笨了,而是代码库本身开始失去结构。 Sentrux 值得看的地方,不是又多了一个静态分析工具,而是它试图给 Coding Agent 补一个反馈器官:在 Agent 动

3 min

YourMemory:Agent 记忆不是越多越好,还要会遗忘

Agent 记忆经常被说成“越多越好”。这话只对了一半。记得越多,确实更像一个长期助手;但如果旧事实、错误偏好、过期项目状态一直留着,Agent 也会被记忆带偏。 `YourMemory` 有意思的地方,是它把“遗忘”也放进了 Agent 记忆系统。 仓库地址:sachitrafa/YourMemory ## 记忆不是

3 min

Xyne:企业搜索别再让 Agent 翻聊天记录

企业里最浪费时间的动作,可能是找东西。文件在 Drive,决策在 Slack,需求在 Jira,线索在邮件,代码在 GitHub,最后每个人脑子里还有一份“只有我知道”的隐性地图。 `Xyne` 盯上的正是这个问题:给工作场景做一个开源的 AI 搜索与问答引擎。 仓库地址:xynehq/xyne ## 它不是普通知识库

3 min

Lunel:手机不是跑代码的机器,而是 AI Coding 的遥控台

手机上写代码这件事,听起来一直有点别扭。屏幕小、键盘慢、上下文看不全,真让人把一台手机当开发机,多少有点遭罪。 `Lunel` 的有趣之处在于,它没有把手机伪装成开发机,而是把手机变成 AI Coding 的遥控台。 仓库地址:lunel-dev/lunel ## 三层架构,比远程桌面克制 Lunel 大致分三层:移动

3 min

小米 MiMo 发 Token:更关键的是测的是国产模型的 Agent 耐力

小米 MiMo-V2.5 系列开源之后,又给开发者放了一波更直接的东西:MiMo Orbit Token 激励。表面看,这是一次免费额度活动;往深一点看,这是国产模型主动争取 AI builder 的一次入口战。 别把它只理解成“薅点 Token”。如果只是领完额度、跑几个聊天问题、截个图发朋友圈,那这波额度基本就浪费

3 min