Coze Loop 教程:Agent 上线前,先把评测、Prompt 和监控闭环补上
Agent 项目最常见的事故,是上线前靠感觉调 prompt,上线后靠用户投诉发现问题。模型换了、工具改了、知识库更新了,没人知道效果从哪天开始变差。 Coze Loop 是面向 AI Agent 优化的平台,覆盖开发、调试、评测、Prompt 管理和线上监控。它的价值不是多一个控制台,而是让 Agent 的质量变化能
Agent 项目最常见的事故,是上线前靠感觉调 prompt,上线后靠用户投诉发现问题。模型换了、工具改了、知识库更新了,没人知道效果从哪天开始变差。 Coze Loop 是面向 AI Agent 优化的平台,覆盖开发、调试、评测、Prompt 管理和线上监控。它的价值不是多一个控制台,而是让 Agent 的质量变化能
AI 做 PPT 最大的问题,不是能不能生成页面,而是生成出来能不能继续改。很多工具输出一堆图片,看着还行,到了客户修改、老板改字、设计调版时就废了。 Banana Slides 押的是另一条路:上传模板图片和素材,让 AI 解析内容,按自然语言生成或修改页面,并导出可编辑 PPTX。它更像一个 AI PPT 工作台,
Coding Agent 的 token 浪费,很多时候不是模型太贵,而是上下文太脏。终端输出、测试日志、重复文件、RAG 片段、工具结果,全都原样塞回去,模型不但花钱,还更容易被噪音带偏。 Headroom 做的是上下文优化层。它可以包装常见 coding agent,也可以作为代理放在应用和模型之间,对消息、工具输
语音 AI 的 demo 通常都很好听。真正落地时,问题才冒出来:长文本断句不自然,显存吃紧,首包延迟高,声音克隆授权不清楚,多说几分钟后情绪和音色开始飘。 MOSS-TTS 是开源语音生成模型家族,覆盖长文本语音、多说话人对话、声音设计、环境声和实时流式等方向。它适合想把 TTS 放到本地或自托管环境里的团队。 但语
做 RAG 时,很多人把注意力放在向量库和模型上,却忽略了最前面的文档解析。PDF 里的表格错位、公式断掉、页眉页脚混进正文,后面检索再强也救不回来。 Chandra OCR 适合处理这类硬文档:复杂表格、表单、手写、多语言、数学公式、版面结构。它能把文档转成 Markdown、HTML 或 JSON,并保留更详细的
很多人做 AI 应用时,第一反应是把业务数据直接塞成 JSON。简单、通用、模型也能读,看起来没毛病。 但一到真实场景,账就不太对了。订单列表、埋点日志、知识库片段、搜索结果、用户画像、商品属性,全都用 JSON 喂给模型,会浪费大量字段名、括号和重复结构。上下文窗口再大,也不能这么霍霍。 TOON 的价值就在这里。它
IBM Granite 4.1 的发布,很适合给开源模型圈泼一点冷静水:小模型路线没有输,输的是粗糙训练和粗糙定位。 Granite 4.1 是 3B、8B、30B 的 dense decoder-only 模型家族,训练管线包含约 15T tokens、多阶段预训练、长上下文扩展、监督微调和多阶段强化学习。更关键的是
Google 第八代 TPU 分成 8T 和 8I 两条线,这件事比单纯“新芯片更强”有意思。 过去讨论 AI 算力,大家很容易只看峰值、参数、集群规模。到了 Agent 时代,负载变复杂了:有长时间训练,有大规模推理,有低延迟交互,有多轮工具调用,还有大量上下文读写。所有任务都用同一种算力形态硬扛,成本会很难看。 #
OpenAI 模型、Codex 和 Managed Agents 进入 AWS,表面看是一次渠道扩展;往深一点看,这是 AI 云生态的一次松动。 过去两年,大模型公司和云厂商的关系很像“强绑定”:谁投钱、谁给算力、谁拿优先分发权。企业采购时也被这种绑定影响,想用某个模型,往往要进入某个云的生态。 现在 OpenAI 出
AI Agent 写代码最容易让人上头。头几天,功能像开闸一样往外冒;再过几天,项目里开始出现幻觉函数、错位依赖、循环引用、God 文件。不是模型突然变笨了,而是代码库本身开始失去结构。 Sentrux 值得看的地方,不是又多了一个静态分析工具,而是它试图给 Coding Agent 补一个反馈器官:在 Agent 动
Agent 记忆经常被说成“越多越好”。这话只对了一半。记得越多,确实更像一个长期助手;但如果旧事实、错误偏好、过期项目状态一直留着,Agent 也会被记忆带偏。 `YourMemory` 有意思的地方,是它把“遗忘”也放进了 Agent 记忆系统。 仓库地址:sachitrafa/YourMemory ## 记忆不是
让 Coding Agent 写普通 Web 代码已经不新鲜了。难的是让它进入一个复杂数据平台:Spark、Unity Catalog、Jobs、MLflow、Model Serving、权限、表结构、流水线规范全都在场。 `Databricks AI Dev Kit` 解决的是这个问题:给 Claude Code、C
企业里最浪费时间的动作,可能是找东西。文件在 Drive,决策在 Slack,需求在 Jira,线索在邮件,代码在 GitHub,最后每个人脑子里还有一份“只有我知道”的隐性地图。 `Xyne` 盯上的正是这个问题:给工作场景做一个开源的 AI 搜索与问答引擎。 仓库地址:xynehq/xyne ## 它不是普通知识库
Vibe Coding 正在把原型设计这件事压得很扁。 以前一个交互原型,可能要设计师画半天、调两天、改三轮。现在你对着 Figma Make、Framer AI、Google Stitch 或类似工具说几句话,一个能点、能跳、能演示的版本就出来了。别管它是不是最终稿,至少老板、产品、开发都能先看见东西。 这对原型设计
手机上写代码这件事,听起来一直有点别扭。屏幕小、键盘慢、上下文看不全,真让人把一台手机当开发机,多少有点遭罪。 `Lunel` 的有趣之处在于,它没有把手机伪装成开发机,而是把手机变成 AI Coding 的遥控台。 仓库地址:lunel-dev/lunel ## 三层架构,比远程桌面克制 Lunel 大致分三层:移动
小米 MiMo-V2.5 系列开源之后,又给开发者放了一波更直接的东西:MiMo Orbit Token 激励。表面看,这是一次免费额度活动;往深一点看,这是国产模型主动争取 AI builder 的一次入口战。 别把它只理解成“薅点 Token”。如果只是领完额度、跑几个聊天问题、截个图发朋友圈,那这波额度基本就浪费
TypeScript 团队做 Agent,常见路线是从前端或 Node 服务里拼一个聊天 demo:接模型、写工具、加一点 memory,再接到页面。能演示,但上线后很快缺东西:trace 看不见,工具失败不好查,RAG 数据难管,guardrail 没地方放,部署也像临时脚本。 VoltAgent 想把这条路工程化:
Agent 想做研究,最先卡住的不是模型,而是“看不见”。网页能不能读,YouTube 字幕怎么拿,Reddit 讨论怎么搜,GitHub 信息怎么查,RSS 怎么订阅,微博客平台怎么处理登录态——这些事情分散又琐碎。 Agent Reach 把问题拆成一套互联网工具箱:网页、RSS、GitHub、YouTube/B
让 Agent 还原 Figma 设计时,最常见的做法是丢一张截图。问题是截图只能给视觉结果,给不了布局层级、间距、字体、颜色 token、frame 结构和命名。模型看得到“长这样”,但很难知道“为什么这样”。 Framelink MCP for Figma 做的是把 Figma 文件、frame 或 group 的
很多人用 Claude Code,习惯是把需求直接扔进去,然后盯着它改。能跑,效率也有,但问题很快出现:产品判断没人做,设计味道没人看,安全审计靠运气,最后发布时再补文档和测试。AI 写代码变快了,工程流程反而容易被省掉。 gstack 值得看的地方,不在“Garry Tan 的同款配置”这个噱头,而在它把 Claud