OctoNews

笔记 · 技术和认知提升

Agent

技术和认知提升中与Agent相关的内容。 共 101 条。

Thread

NVIDIA 把 Agentic AI 拆成六门课

我翻了一遍路径 比「再看一个 Agent demo」有用 怎么搭 Agent 怎么做 Agentic RAG 怎么评测 怎么定制 怎么做更深的 Agent 最后一门直接讲更安全的自主 Agent 很多人卡在第一课的兴奋感里 真正分水岭往往在评测和安全 能跑起来和敢放出去 中间差一整段工程

Thread

Claude Code 做到一半关掉

同一目录打开 Codex 不用再解释架构、踩过的坑、没答完的问题 ai-memory 给 coding agent 做长期记忆 会话结束写成 wiki 下一个 agent 先读交接 换模型不难 难的是上下文每次归零

Thread

AI Agent 开始碰真机了。

不是模拟器 是真 iPhone、真 Android 看屏幕、点按钮、滑动、打字、开设置 开源项目 Mobile Harness 把眼睛和手接到手机上 本地也能跑,云设备也能规模化 Agent 上一阶段主要在写代码 这一阶段开始用你手机上的 App

Thread

30B 的 agent 模型,宣称 24GB VRAM 就能跑?

Muse Glimmer 开源了(Apache 2.0,权重在 Hugging Face):规划、工具调用、自检、失败恢复内建。 4-bit 量化把内存压到 20GB 以下,还留空间给 KV cache 与 drafter。 本周起可走 ollama / LM Studio / vLLM / sglang 等路径,也兼容 llama.cpp、MLX。 自架 agent 的门槛又下一截——真假强弱仍

Thread

做 AI Agent 最容易低估的,其实是聊天界面。

Streaming、重试、附件、代码块、Tool Call、用户确认……看起来只是 Chat UI,自己补一遍很耗时。 assistant-ui 把这些收成可组合的 React 组件,Tool Call 还能渲染成你自己的 UI。 更关键:不绑死后端,Vercel AI SDK、LangGraph、自建 API 都能接。 Vibe Coding 做 AI SaaS 时,我更想把时间花在 Agent

前阵子大家疯抢 Mac mini,是为了自己养一只 AI Agent。

现在剧情可能反转:Gemini Spark 这类产品上来后,「自己架虾」可能变成少数派。 Spark 能做的事很日常:定时任务、监控主题、Gmail 触发、整理 Docs/Sheets、建 Skill、接 MCP。 以前 Agent 更像工程师玩具;现在大厂在把它做成普通人的生产力按钮。 小龙虾不一定失业,但「人人自建 runtime」这件事,正在变贵、变可选。 真正差距会变成:你知不知道该把什么

来逆风说一句 DeepSeek V4 Flash(本地 MXFP4 / Mac Studio M3 Ultra / oMLX)。

我不是聊天玩玩,是直接塞进 Codex 当主模型跑完整 agent。 会写代码,但很难稳稳收尾:修 A 坏 B,还得再拉别的模型 review。 固定 100 题粗测(本地量化,不代表 API): 编程 28/29 很好;完整集 75.5 一般;专案记忆 40% 差;工具流 66.7%、agent 规划 64.3% 不够稳;没图时还会捏造——这点危险。 结论:写 code 可以,当 Codex 主

Thread

你的技能文件存在公司代码库里,还是自己手里?

YC CEO Garry Tan 最近提了个挺尖锐的说法:个人积累的判断力和工作流,如果存在公司代码库里,会被无情榨取;存在自己掌控的仓库里,才是可携带、可复利的职业资产。 他把这套思路叫 Personal AGI——不是租外部大模型 API,而是搭建一个只属于你自己的智能体:读你的记忆,跑你的程序,随你使用越用越值钱。 四个支点:智能资产化、Markdown 即代码=生产力、Agent 行动能力

Article

为什么 AI 时代还需要继续用 Anki

跟 ChatGPT 聊完,我会有种「这下懂了」的爽感 两周后再被问到同一个细节 脑子里经常只剩浆糊 模型讲得挺清楚 是我会忘 我现在的用法就一句 **AI 负责学得快** **Anki 负责忘得慢** 下载:[Anki](https://apps.ankiweb.net/) --- 我现在学东西,大量靠大模型 追问、举反例、当场考我 启动成本几乎为零 当场理解变强了 过一阵还是会忘 当场 quiz

Article

我不想再“剪下一条视频”了,所以做了 TudouFlow

> 从选题、脚本、画面、配音、字幕,到横竖版成片、封面和平台文案:这是我把个人 AI 视频工作流改造成一套生产系统的过程。 我做 AI 视频之后,遇到的最大问题一直不是“不会做”。 真正的问题是:**每做一期,都像第一次做。** 选题时重新查资料,写稿时重新搭结构,文案定了才开始想画面。横版做完,还要重新处理竖版;配音分段生成后,可能每一段语速都不一样;临到发布,又发现字幕、封面、简介和标签还没有

一直以为本地模型顶多能聊天、写点简单代码,实测发现能干的比这多。

用 Hermes agent 配 mlx 跑的 Qwen3.6 35b A3b,全程本地,没连任何云端 API。 给它的任务是装一个叫 cork 的软件(homebrew 的图形界面)。它自己上网搜到对应的 GitHub repo,clone、编译、装进 /Applications,一条龙做完。 这种自己找资料、自己动手装软件的多步骤 agent 任务,以前觉得只有云端大模型才靠得住,现在本地也能

Article

百度网盘 - 闲鱼 MCP 一键发布,让你有价值的资料变成持续赚钱的机器

你网盘里是不是也躺着几十个 G 的资料?真正卡住你上架闲鱼的,往往不是「有没有货」,而是那套重复劳动:翻文件夹找素材、下载到本地、开闲鱼网页填标题图价格、点发布——每一件新货都要重来一遍。 这套重复劳动,够格交给 Agent 做,你只需要最后点头确认。 今天讲的就是这条链路:**百度网盘 + 闲鱼 + Agent(MCP)**。 把网盘接成工具,把闲鱼接成工具,再串成「找资料 → 写介绍 → 打草

Thread

学大模型最缺的不是理论,是能跟着敲代码的教程——尤其还得是中文的。

dive-into-llms 刚好补上这个空:上海交大张倬胜团队出的 11 章实战课,每章配讲义 PDF 加可执行 Notebook,从微调、提示工程讲到 RLHF、多模态、GUI agent,连越狱攻击和 agent 安全这种进阶内容都覆盖了。 GitHub 44.9K star,今天单日涨 654,说明真有人在用。 全中文,边学边改代码,不需要去看大量英文论文。

Thread

能不能在 Claude Code、Codex、Cursor 这些 coding agent 之间随便换着用还不丢上下文?

有人把这事做成了开源项目,叫 Portable Resume。思路挺干净:不是硬唤醒你原来那个 session,也不启动来源的 CLI,只是离线读一遍本机记录,整理出一份能带走的交接文档,扔给新 agent 接着干。 目前已经做到 8 个来源对 8 个目的端全覆盖。 想试的话,一条命令 pipx install portable-resume 就够了。

Thread

想同时给大陆直连、海外也能打开的项目站,别再死磕 Vercel / github.io 了。

我试下来最省事的是 Cloudflare Pages:域名长这样 xxxx.pages.dev。 节点常在香港,大陆直连多半能上;海外也稳。免费,还能绑 GitHub 自动部署。 Vercel、Railway、OnRender、GitHub Pages、腾讯 EdgeOne、自己买域名建站我都试过。 要「两边都能连 + 省钱 + 上手快」,还是 CF Pages。 不是最炫,是最省心。 懒人玩法:

Article

用 ChatGPT Sites 搭一个带登录的私有文件 Host

上一篇写了 ChatGPT Sites 怎么快速发一个网站([链接](https://x.com/iluciddreaming/status/2078313581851083183))。 这篇讲一个更偏工程向的玩法:**用 Sites 搭一个带登录的私有文件 Host**——可以上传、下载、浏览文件,也能用脚本把本地目录同步到站点。重点不是空间有多大,而是 Sites 把 **Workers +

Thread

玩 Multi-Agent 大半年,我仍坚持:

LLM 可替换;Architecture 可替换;Harness 可替换;IDE / Skill / Knowledge 都可替换。 值得长期养的,是 Identity / Memory——你是谁、做过什么、偏好什么。 工程上也一样:记得住上下文,才谈得上持续协作。

腾讯 WorkBuddy 产品负责人汪晟杰说:

每个 App 背后都该有对应 CLI;有了 CLI,大模型才能直接调。CLI 不是目的——是为了让模型理解系统,调用时不必绕 GUI。 GUI 的颜色和按钮是给人看的。让 Agent 等页面加载、点按钮,是绕远路。命令行和结构化数据,对它直接得多。 入口若变成 Agent:人 ↔ Agent ↔ CLI ↔ 软件。

Thread

open-slide 的 Morph Transition 正式发布了。

以前 Keynote 的 Magic Move 最香:自动认前后页相同元件,做移动缩放转场,演示立刻专业一截。 现在跟 Agent 说一句「我要 Morph Transition」,内置 skill 就会教它怎么生成。 框架不是替代 Agent,是给投影片特效搭脚手架——Codex / Claude Code 照样驱动。 GitHub:https://github.com/1weiho/open-