video-use 上手:让 Coding Agent 真的剪出 final.mp4
视频剪辑进入 Agent 工作流以后,最容易被误解成“一句话生成视频”。真正有用的方向不是凭空生成,而是把已有素材变成可审计、可重跑的编辑流程:识别素材、切掉废话、调色、加字幕、加动画、渲染、检查边界,再输出 final.mp4。 browser-use/video-use 正是这个方向。它让 Claude Code、
共 73 篇文章
视频剪辑进入 Agent 工作流以后,最容易被误解成“一句话生成视频”。真正有用的方向不是凭空生成,而是把已有素材变成可审计、可重跑的编辑流程:识别素材、切掉废话、调色、加字幕、加动画、渲染、检查边界,再输出 final.mp4。 browser-use/video-use 正是这个方向。它让 Claude Code、
很多本地模型方案都绕不开下载模型、选量化、配显存、调推理服务。Mac 用户还有另一条路:把系统自带的 Apple Intelligence 变成命令行工具和本地 OpenAI 兼容接口。apfel 做的就是这件事。 它把 Apple FoundationModels 暴露成 UNIX CLI、交互式聊天和本地 Open
Ubuntu 上的防火墙不难,难的是很多人一开始就把它想歪了:不是背几条 `ufw allow`,也不是把所有端口一关就叫安全。真正能长期维护的防火墙配置,应该回答三个问题:这台机器对外提供什么服务、谁能访问、出了问题怎么安全回滚。 Ubuntu 默认推荐的入口是 UFW,也就是 Uncomplicated Firew
终端正在被重新定义。过去它主要负责执行命令;现在,随着 Coding Agent 进入日常开发,终端开始承担上下文组织、任务分派、输出审查和远程执行入口的角色。
AI 写前端,最容易出现一种熟悉的味儿:居中的大标题,蓝紫渐变背景,三张等宽功能卡片,按钮带一点发光,下面再塞几个“Seamless / Next-Gen / Elevate”之类的词。 功能可能是对的,但一眼就知道是模型直接吐出来的。不是不能用,就是不太像一个认真做过视觉判断的产品页面。 Taste Skill 做的
Agent Zero 这类项目,最容易被写成“又一个自主 Agent 框架”。这话不能算错,但没抓到重点。 它更关键的地方,不是会聊天,也不是会调用几个工具,而是把 Agent 放进一台完整的 Linux 工作台里:有文件系统,有终端,有浏览器,有记忆,有项目隔离,有插件和技能,还能把任务继续拆给子 Agent。
大模型成本控制最常见的错误,是只盯单价。单价当然重要,但真正烧钱的,是简单任务也走最贵模型,失败重试又继续走最贵模型,最后账单一看,像开了水龙头。 UncommonRoute 的思路是加一层自动路由。它作为 OpenAI 兼容代理,帮你判断请求复杂度,把简单任务交给便宜模型,把复杂任务交给更强模型。项目强调最高可以节省
AI 写小说最常见的失败,不是写不出字,而是写着写着就散了。人物性格漂,节奏乱,前后设定打架,越到后面越像自动续杯的套路汤。 InkOS 值得看的地方,是它没有把自己包装成一个“输入一句话生成百万字”的玩具,而是把小说创作拆成写、审、改、人工审核几个环节。它是一个自动化小说写作 Agent,也发布成 OpenClaw
多 Agent 工作流一多,聊天窗口就不够用了。哪个 Agent 正在跑,花了多少钱,装了哪些 skills,失败任务在哪里,谁有权限触发高风险动作,都需要一个控制台。 Mission Control 做的是自托管 Agent orchestration dashboard。它强调 SQLite、单命令运行、Skill
Agent 项目最常见的事故,是上线前靠感觉调 prompt,上线后靠用户投诉发现问题。模型换了、工具改了、知识库更新了,没人知道效果从哪天开始变差。 Coze Loop 是面向 AI Agent 优化的平台,覆盖开发、调试、评测、Prompt 管理和线上监控。它的价值不是多一个控制台,而是让 Agent 的质量变化能
AI 做 PPT 最大的问题,不是能不能生成页面,而是生成出来能不能继续改。很多工具输出一堆图片,看着还行,到了客户修改、老板改字、设计调版时就废了。 Banana Slides 押的是另一条路:上传模板图片和素材,让 AI 解析内容,按自然语言生成或修改页面,并导出可编辑 PPTX。它更像一个 AI PPT 工作台,
Coding Agent 的 token 浪费,很多时候不是模型太贵,而是上下文太脏。终端输出、测试日志、重复文件、RAG 片段、工具结果,全都原样塞回去,模型不但花钱,还更容易被噪音带偏。 Headroom 做的是上下文优化层。它可以包装常见 coding agent,也可以作为代理放在应用和模型之间,对消息、工具输
语音 AI 的 demo 通常都很好听。真正落地时,问题才冒出来:长文本断句不自然,显存吃紧,首包延迟高,声音克隆授权不清楚,多说几分钟后情绪和音色开始飘。 MOSS-TTS 是开源语音生成模型家族,覆盖长文本语音、多说话人对话、声音设计、环境声和实时流式等方向。它适合想把 TTS 放到本地或自托管环境里的团队。 但语
做 RAG 时,很多人把注意力放在向量库和模型上,却忽略了最前面的文档解析。PDF 里的表格错位、公式断掉、页眉页脚混进正文,后面检索再强也救不回来。 Chandra OCR 适合处理这类硬文档:复杂表格、表单、手写、多语言、数学公式、版面结构。它能把文档转成 Markdown、HTML 或 JSON,并保留更详细的
很多人做 AI 应用时,第一反应是把业务数据直接塞成 JSON。简单、通用、模型也能读,看起来没毛病。 但一到真实场景,账就不太对了。订单列表、埋点日志、知识库片段、搜索结果、用户画像、商品属性,全都用 JSON 喂给模型,会浪费大量字段名、括号和重复结构。上下文窗口再大,也不能这么霍霍。 TOON 的价值就在这里。它
IBM Granite 4.1 的发布,很适合给开源模型圈泼一点冷静水:小模型路线没有输,输的是粗糙训练和粗糙定位。 Granite 4.1 是 3B、8B、30B 的 dense decoder-only 模型家族,训练管线包含约 15T tokens、多阶段预训练、长上下文扩展、监督微调和多阶段强化学习。更关键的是
Google 第八代 TPU 分成 8T 和 8I 两条线,这件事比单纯“新芯片更强”有意思。 过去讨论 AI 算力,大家很容易只看峰值、参数、集群规模。到了 Agent 时代,负载变复杂了:有长时间训练,有大规模推理,有低延迟交互,有多轮工具调用,还有大量上下文读写。所有任务都用同一种算力形态硬扛,成本会很难看。 #
OpenAI 模型、Codex 和 Managed Agents 进入 AWS,表面看是一次渠道扩展;往深一点看,这是 AI 云生态的一次松动。 过去两年,大模型公司和云厂商的关系很像“强绑定”:谁投钱、谁给算力、谁拿优先分发权。企业采购时也被这种绑定影响,想用某个模型,往往要进入某个云的生态。 现在 OpenAI 出
AI Agent 写代码最容易让人上头。头几天,功能像开闸一样往外冒;再过几天,项目里开始出现幻觉函数、错位依赖、循环引用、God 文件。不是模型突然变笨了,而是代码库本身开始失去结构。 Sentrux 值得看的地方,不是又多了一个静态分析工具,而是它试图给 Coding Agent 补一个反馈器官:在 Agent 动
让 Coding Agent 写普通 Web 代码已经不新鲜了。难的是让它进入一个复杂数据平台:Spark、Unity Catalog、Jobs、MLflow、Model Serving、权限、表结构、流水线规范全都在场。 `Databricks AI Dev Kit` 解决的是这个问题:给 Claude Code、C