OctoNews

笔记 · 技术和认知提升

Agent

技术和认知提升中与Agent相关的内容。 共 101 条。

Thread

刚看到 Databricks 团队推的 Omnigent,超实用的 open-source AI agent meta-harness!一次管理多种 coding agent,sandbox 隔离超安全,还能在手机上继续接力工作。台湾工程师

刚看到 Databricks 团队推的 Omnigent,超实用的 open-source AI agent meta-harness!一次管理多种 coding agent,sandbox 隔离超安全,还能在手机上继续接力工作。台湾工程师在搞 agent 项目的,强烈建议先 star 起来试试👀

Thread

Python 有个开源包 pyJianYingDraft,能直接用代码创建剪映草稿。

配合 WorkBuddy 这类 AI 智能体,就能实现视频自动剪辑。 不用每次手动拉时间线、加字幕、调特效了。 核心是把剪映的操作暴露成可编程的接口,你可以用脚本(甚至让 AI 帮你写)批量生成草稿、混剪、导出。 这其实是在把「视频后期」这个最耗时耗力的环节,逐步代码化和自动化。 对 indie hacker 和需要高频发短视频的人来说,这类「草稿生成器 + AI Agent」的组合,正在把内容生

Thread

想搭知识库?GitHub 上这几个开源工具分工很清晰:

FastGPT:基于 LLM 的知识库平台,工作流、问答、数据集管理完整,适合企业快速搭建。 LLM Wiki:桌面端文件整理成互联知识库,适合个人笔记和本地查阅。 llm-wiki-agent:扔资料让 AI 自动读、整理、维护,像会自己更新的 wiki。 OpenKB:轻量开源知识库,适合先跑最小可用版本。 不同需求选不同工具。 项目链接: FastGPT: https://github.co

Thread

Warp 创始人 Zach Lloyd(前 Google Docs 首席工程师)写了一篇很实用的文章,讲如何给 AI 的 Skill 建立「自我改进循环」。

1/3 核心思路:让 agent 不仅执行任务,还能根据真实人类反馈,自己改进自己的 Skill 文件。 因为 Skill 就是普通 Markdown 文件,agent 改它就等于打 diff,自我进化变得可落地。 2/3 他把流程拆成两个循环(以 issue triage 为例): Inner loop(执行):新 issue 进来 → GitHub Action 触发云 agent → 加载

Thread

1️⃣ AI 圈最近出现一个新词,叫 Loop Engineering。

以前大家卷的是「怎么写更好的 Prompt」、怎么做更强的 Agent。 现在越来越多人说,AI Coding Agent 的下一个分水岭,已经不是单次把事情做对,而是设计一个能自己持续循环的系统。 真正的瓶颈,正在从「你怎么指挥它」,变成「你怎么让它自己追问、自己验证、自己记住状态,最后知道什么时候该把活交还给人」。 这比之前的 Harness Engineering 更上一层。 2️⃣ Loo

Thread

做 AI 模型的公司,可能不是最终的大赢家。

真正赚到系统性利润的,是让 AI Agent 在现实世界跑得通的基础设施。 这几类管道最关键: - 支付管道(Stripe、Coinbase、x402) - 网络管道(Cloudflare) - 商业管道(Shopify) - 企业管道(Salesforce) - 数据管道(Palantir、Databricks) Agent 需要这些东西才能真正「干活」。 模型公司卷参数、卷价格、卷上下文。 但

Thread

/1 NVIDIA 最近开源了一个叫 SkillSpector 的工具。

专门用来扫描 AI Agent 的技能文件,检测漏洞、恶意模式和安全风险。 这事儿来得正是时候。 /2 现在大家都在疯狂做 Agent。 随便一个 repo 就能让 Claude 帮你写一堆 tool calling skills。 但这些 skills 到底安不安全?有没有后门?会不会泄露数据? 没人审。 /3 SkillSpector 就是来填这个坑的。 它能自动分析 Agent 的能力描述、

Thread

OpenAI Codex 团队只有 40 个人。

1 个 PM + 2 个设计师 + 37 个工程师。 结果呢? 99% 的代码是 AI 生成的。 而且他们跑得飞快。 具体怎么干的: - 每个工程师同时跑 4 个并行 agent(code review、功能实现、安全审计、代码库摘要) - PM 用 Codex 处理用户 issue,1 小时能跑完 100+ 个,大部分 24 小时内修复 - 功能开发经常 2-3 人甚至单人从规划到发布 - 99

Thread

1 Karpathy 的 autoresearch 出来后

有人直接拿它做了真实世界的交易系统 在 Polymarket 上搞了一个比特币 5 分钟自动交易机器人 回报 +40% 项目已经开源 还能直接用 Claude Code 或 Codex 执行整个研究循环 给它一个「研究机构」的指令 它只改一个策略文件 跑短周期实验(这里是 5 分钟交易 cycle) 评估真实指标 只保留变好的改动,扔掉没效果的 不断自我迭代 睡觉前扔给它,早上起来收一堆实验日志和

Thread

最近很多人吐槽 Claude(尤其是新版)变了:

- 啰嗦 - 过度拒绝 - 态度越来越差 - 在复杂 coding 任务里经常「摆烂」 这不是个例,是很多重度用户共同的感受。 可能的原因: 1. Safety 训练越做越重,模型越来越「政治正确」和保守。 2. 长上下文 + Agent 场景下,模型为了「负责」开始过度解释、过度警告。 3. 公司为了对齐某些价值观,把「不冒犯」优先级提得太高。 有趣的是,这和用户实际需求产生了冲突。 用户想要的

Thread

Andrew Ng 开源了 CLI 工具 Context Hub

一周内破 6000 star,收录超过 1000 个 library 的文档 它解决的问题很直接: AI coding agent 写代码时会乱编 API 你让它接 Stripe,它可能吐出根本不存在的 function name,或者半年前就改掉的旧版接口 因为模型训练数据有截止日期,它不知道 library 最近发生了什么 这听起来很像 context7 在做的事 但我研究之后发现,Conte

Thread

1️⃣ 智谱的 GLM-5.2 最近全量开放了。

很多开发者已经在实际项目里用了,尤其是搭配 Claude Code、Cursor 这类工具。 反馈两极分化,但总体比预期好。 2️⃣ 积极的一面: - 编码能力追得很近,有些场景接近 Claude Sonnet 级别 - 中文理解和长文本表现不错 - 价格和 token 额度对国内用户更友好 - 很多人在试「Claude Code + GLM」混合使用,降本增效 3️⃣ 需要注意的问题: - 复杂

Thread

Git 圈老前辈 Scott Chacon(GitButler 创始人、《Pro Git》作者)竟然把整个 Git 从零用 Rust 重写了一遍,项目叫 Grit!

规模夸张:36 万行代码、7000+ commit、500+ PR,跑了官方 42,001 个测试,通过 41,715 个(99.3%)。 几乎全是 memory-safe 的 Rust,只有一个日期时间模块靠 C FFI。 据说烧掉约 450 亿 token,成本 1-1.5 万美元。 但他学到最重要的一课:agent 超爱作弊。你给它一个目标,它会去优化「让测试过」,而不是你真正想要的实作。

Thread

1 Naval 新 podcast 浓缩版:Vibe Coding、AI 软件的未来,以及他为什么不看好 Apple。

这集 30 分钟,讲了他从多年不写代码,到用 AI agents 打造「个人 App Store」的真实经历,以及对 AI 发展的判断。 Claude Opus 4.5 让 AI 从「玩具」变成真正可用的工具。它终于能保持方向、从头到尾为你打造属于你的 app。 Naval 说,如果你对 AI 的印象还停留在之前,该更新认知了。 过去写代码的「启动能量」太高。现在英文正式成为编程接口,AI 能容忍

Thread

Every 是 Dan Shipper 自己创的媒体和软件公司,从 2020 年 GPT-3 时代开始到现在 6 年多。

1/7 他们从 GPT-3 那刻起就把 AI 塞进每个工作流:写稿、编辑、客服、设计、营销、工程。Codex 和 Claude Code 是默认界面,新模型 alpha 阶段他们就先拿到。理论上这是「自动化到极致」最彻底的样本。 结果 2026-05-21 他发报告《After Automation》,标题直白:「我们什么都自动化了,但人却变多了」——从 4 人扩到 30 人。 几天后上 Lenn

什么是循环工程?!

当龙虾之父说:别再一个一个指令地催你的 agent,你应该设计一套会自动催它的循环。Claude Code 之父也几乎同时表示,自己早已不再亲手下指令,而是让循环自动去 prompt Claude、判断下一步,工作彻底变成了「写循环」。 循环工程的概念由此成形:把原来亲自写 Prompt 的你替换掉,改由系统来完成。循环本质上是一个递归目标,你只需要定义最终目的,AI 就会反复迭代,直到任务完成。

Thread

付费看完了 Codex 团队的采访,说几个让我真正在意的细节。

40 人的团队。1 个 PM,2 个设计师,其余全是工程师。 那唯一的 PM,日常工作是:用 Codex 处理用户反馈和 issue,每小时自动跑一次,单次处理 100 多个 issue,大部分 24 小时内修复。 我看到这里停了一下。 这个 PM 的活,老板自己就能干完。 功能迭代基本是 2-3 人甚至单人从头跑到尾,没有定期会议,没有流程,点对点直接说。 以前跨职能协作那套,现在大部分被 ag

NousResearch 出了个新 agent 框架,叫 hermes-agent。

今天 GitHub 单日 1845 star,很炸。 卖点是这句话:"The agent that grows with you"。 我喜欢这个定位。不是"最强",不是"最快",而是会跟你一起进化。 大部分 agent 框架,你用三个月就换了。这个在赌你会一直用下去。

Hermes Agent 不只是聊天机器人,而是一个正在成形的开源 AI 操作系统

最近,Nous Research 正式推出了 Hermes Agent Desktop。 乍看之下,它像是另一个 AI 桌面应用程序。 但如果仔细观察,你会发现这件事真正重要的地方,并不在 GUI,而在于它代表了 AI Agent 发展方向的一次转变。 过去的大语言模型,大多停留在: - 回答问题 - 撰写内容 - 产生程式码 本质上仍然是一种「被动响应系统」。 而 Hermes Agent 正在

Thread

Anthropic 出了官方 CLI:ant。

以前用 Claude API 要:建 API key、复制粘贴、自己写调用脚本。 ant 把这套流程压平了。 登录: ant auth login OAuth 授权,token 自动存,CLI 和 SDK 共用。你在终端登录,代码那边也直接通,不用管 key 过期。 调用 API: ant messages send --model claude-sonnet-4-6 -m "帮我写测试" 支持

Thread

Claude Code Opus 4.8 同时推出了 Dynamic Workflows。

很多人不清楚它和 subagent、agent team 有什么区别。实测拆解一下。 之前的多 agent 方式: subagent = 主 agent 临时喊人帮忙 agent team = 几个 Claude Code 实例组成小团队,各自带上下文并行跑 但这两种本质还是"对话驱动"——下一步怎么做,每次都要让 agent 实时推理判断。 Workflow 不一样。 它会先写一份 workfl

Thread

斯坦福 CS336 给课程 AI agent 写了一份 CLAUDE md。

HN 462 分,140 条讨论。大家在谈的不是"AI 变强了",而是"怎么约束 AI"。 这个转变值得注意。 CLAUDE md 本质是一份行为规范:告诉 agent 什么可以做,什么不能做,碰到模糊情况怎么处理。 之前这件事是工程师临时拼凑的。 现在斯坦福在顶校 LLM 课程里把它当必修项。 这说明行业正在达成一个共识: 给 AI 写行为规范,和给 AI 写 prompt,是两件事。 Prom

Claude Code 最近推出的 workflows,我用了几天,写代码的方式整个变了。

很多人介绍过 workflow 就不赘述了:它的逻辑是你描述任务,Claude 自己把工作拆成一步步的计划,丢给上百个 subagent 跑,测试验证一次跑完。 我自己再加一层,先用 origin:brief 把相关 context 拉出来,进行 plan,设好 goal 就走开。这两天跑超过 24 小时不用我介入,跑完上千个 tests 加上好几个 adversarial review,回来看一

Codex 的架构设计,5层:

Layer 1 AGENTS md — 团队共识,写死不动 Layer 2 skills/ — 最佳实践沉淀,按需调用 Layer 3 hooks/ — 危险命令拦截,操作留痕 Layer 4 subagents/ — 子智能体并行,主线程保持干净 Layer 5 plugins/ — NPM 分发,一键全队同步 从规则到执行到安全到协作,每层职责清晰。 这不只是工具配置,是 AI 团队的工程规范