NVIDIA 把 Agentic AI 拆成六门课
我翻了一遍路径 比「再看一个 Agent demo」有用 怎么搭 Agent 怎么做 Agentic RAG 怎么评测 怎么定制 怎么做更深的 Agent 最后一门直接讲更安全的自主 Agent 很多人卡在第一课的兴奋感里 真正分水岭往往在评测和安全 能跑起来和敢放出去 中间差一整段工程
七夕到了,恋爱中学会这 11 个技能,谁都招架不住。
1. 上下文压缩 2. 长期记忆检索 3. Function Calling 4. MCP 工具调用 5. 多模态理解 6. Agent 自主规划 7. RAG 检索增强 8. Structured Output 9. Computer Use 10. 递归自我改进 11. v我50
Claude Code 做到一半关掉
同一目录打开 Codex 不用再解释架构、踩过的坑、没答完的问题 ai-memory 给 coding agent 做长期记忆 会话结束写成 wiki 下一个 agent 先读交接 换模型不难 难的是上下文每次归零
AI Agent 开始碰真机了。
不是模拟器 是真 iPhone、真 Android 看屏幕、点按钮、滑动、打字、开设置 开源项目 Mobile Harness 把眼睛和手接到手机上 本地也能跑,云设备也能规模化 Agent 上一阶段主要在写代码 这一阶段开始用你手机上的 App
30B 的 agent 模型,宣称 24GB VRAM 就能跑?
Muse Glimmer 开源了(Apache 2.0,权重在 Hugging Face):规划、工具调用、自检、失败恢复内建。 4-bit 量化把内存压到 20GB 以下,还留空间给 KV cache 与 drafter。 本周起可走 ollama / LM Studio / vLLM / sglang 等路径,也兼容 llama.cpp、MLX。 自架 agent 的门槛又下一截——真假强弱仍
做 AI Agent 最容易低估的,其实是聊天界面。
Streaming、重试、附件、代码块、Tool Call、用户确认……看起来只是 Chat UI,自己补一遍很耗时。 assistant-ui 把这些收成可组合的 React 组件,Tool Call 还能渲染成你自己的 UI。 更关键:不绑死后端,Vercel AI SDK、LangGraph、自建 API 都能接。 Vibe Coding 做 AI SaaS 时,我更想把时间花在 Agent
微软开源了 Skill Recorder:你操作一次,它录全过程,再让 GitHub Copilot 整理成「意图 + 步骤」,生成可复用的 Skill / Automation,给 Agent 之后直接跑。
一句话:录一次示范,Agent 以后自己做。 支持 macOS / Windows。 仓库在第二条。
前阵子大家疯抢 Mac mini,是为了自己养一只 AI Agent。
现在剧情可能反转:Gemini Spark 这类产品上来后,「自己架虾」可能变成少数派。 Spark 能做的事很日常:定时任务、监控主题、Gmail 触发、整理 Docs/Sheets、建 Skill、接 MCP。 以前 Agent 更像工程师玩具;现在大厂在把它做成普通人的生产力按钮。 小龙虾不一定失业,但「人人自建 runtime」这件事,正在变贵、变可选。 真正差距会变成:你知不知道该把什么
来逆风说一句 DeepSeek V4 Flash(本地 MXFP4 / Mac Studio M3 Ultra / oMLX)。
我不是聊天玩玩,是直接塞进 Codex 当主模型跑完整 agent。 会写代码,但很难稳稳收尾:修 A 坏 B,还得再拉别的模型 review。 固定 100 题粗测(本地量化,不代表 API): 编程 28/29 很好;完整集 75.5 一般;专案记忆 40% 差;工具流 66.7%、agent 规划 64.3% 不够稳;没图时还会捏造——这点危险。 结论:写 code 可以,当 Codex 主
你的技能文件存在公司代码库里,还是自己手里?
YC CEO Garry Tan 最近提了个挺尖锐的说法:个人积累的判断力和工作流,如果存在公司代码库里,会被无情榨取;存在自己掌控的仓库里,才是可携带、可复利的职业资产。 他把这套思路叫 Personal AGI——不是租外部大模型 API,而是搭建一个只属于你自己的智能体:读你的记忆,跑你的程序,随你使用越用越值钱。 四个支点:智能资产化、Markdown 即代码=生产力、Agent 行动能力
矽谷传统职位正在怎么改变?不是旧职位消失,是原本分开的职能在合并。
六条正在发生的转变: - Product Manager → 自己做原型、分析数据、用 AI 建工作流 - Frontend/全栈工程师 → 不只完成 ticket,要理解客户、对产品结果负责 - ML 工程师/数据科学家 → 从模型和 notebook,转向 Agent、RAG、部署、商业成果 - DevOps/SRE → 要懂 GPU、推理成本、模型服务、Agent orchestration
大多数人理解的 multi-agent,还停留在“多个 agent 轮流回答问题”。
Anthropic 这次开源的系统不是这个层级:员工管理、财务、采购,agent 之间互相分派任务,全程没有人介入决策链。 这才是 agentic workflow 该有的样子——不是给你一个能力更强的单个模型,是给一整套能自己运转的组织架构。值得花一小时拆解一遍。
很多人担心 AI 写代码“能跑但不专业”——变量命名乱、没测试、架构随手拍。
Addy Osmani(Google Chrome 团队)把这个问题系统化解决了:agent-skills 是一套面向 Claude Code、Codex、Cursor 的工程规范库,覆盖代码质量、测试策略、架构规范,相当于给 AI 装了一个资深工程师的习惯。 GitHub Trending 第二,83k+星,今天涨593,值得收藏备用。
为什么 AI 时代还需要继续用 Anki
跟 ChatGPT 聊完,我会有种「这下懂了」的爽感 两周后再被问到同一个细节 脑子里经常只剩浆糊 模型讲得挺清楚 是我会忘 我现在的用法就一句 **AI 负责学得快** **Anki 负责忘得慢** 下载:[Anki](https://apps.ankiweb.net/) --- 我现在学东西,大量靠大模型 追问、举反例、当场考我 启动成本几乎为零 当场理解变强了 过一阵还是会忘 当场 quiz
腾讯云开源了个东西,叫 TencentDB Agent Memory,专治 AI Agent 每次对话都忘个一干二净的老毛病。
它把对话、文档、代码打包成四类可复用记忆资产(Chat Memory / Skill / LLM-Wiki / Code-Graph),团队里所有 Agent 共用同一套记忆,不用各自重新学一遍。 今天涨了 1111 星,总数 14212,直接冲上 GitHub Trending 第一。
别再让 Agent 死等 OCR。
Firecrawl 开源 pdf-inspector: - 20ms 级分类 - 直接抽 Markdown - 200 份约 2.8 秒 - Rust,表格图表友好 Agent 读文档,终于不那么卡。
我不想再“剪下一条视频”了,所以做了 TudouFlow
> 从选题、脚本、画面、配音、字幕,到横竖版成片、封面和平台文案:这是我把个人 AI 视频工作流改造成一套生产系统的过程。 我做 AI 视频之后,遇到的最大问题一直不是“不会做”。 真正的问题是:**每做一期,都像第一次做。** 选题时重新查资料,写稿时重新搭结构,文案定了才开始想画面。横版做完,还要重新处理竖版;配音分段生成后,可能每一段语速都不一样;临到发布,又发现字幕、封面、简介和标签还没有
一直以为本地模型顶多能聊天、写点简单代码,实测发现能干的比这多。
用 Hermes agent 配 mlx 跑的 Qwen3.6 35b A3b,全程本地,没连任何云端 API。 给它的任务是装一个叫 cork 的软件(homebrew 的图形界面)。它自己上网搜到对应的 GitHub repo,clone、编译、装进 /Applications,一条龙做完。 这种自己找资料、自己动手装软件的多步骤 agent 任务,以前觉得只有云端大模型才靠得住,现在本地也能
百度网盘 - 闲鱼 MCP 一键发布,让你有价值的资料变成持续赚钱的机器
你网盘里是不是也躺着几十个 G 的资料?真正卡住你上架闲鱼的,往往不是「有没有货」,而是那套重复劳动:翻文件夹找素材、下载到本地、开闲鱼网页填标题图价格、点发布——每一件新货都要重来一遍。 这套重复劳动,够格交给 Agent 做,你只需要最后点头确认。 今天讲的就是这条链路:**百度网盘 + 闲鱼 + Agent(MCP)**。 把网盘接成工具,把闲鱼接成工具,再串成「找资料 → 写介绍 → 打草
学大模型最缺的不是理论,是能跟着敲代码的教程——尤其还得是中文的。
dive-into-llms 刚好补上这个空:上海交大张倬胜团队出的 11 章实战课,每章配讲义 PDF 加可执行 Notebook,从微调、提示工程讲到 RLHF、多模态、GUI agent,连越狱攻击和 agent 安全这种进阶内容都覆盖了。 GitHub 44.9K star,今天单日涨 654,说明真有人在用。 全中文,边学边改代码,不需要去看大量英文论文。
能不能在 Claude Code、Codex、Cursor 这些 coding agent 之间随便换着用还不丢上下文?
有人把这事做成了开源项目,叫 Portable Resume。思路挺干净:不是硬唤醒你原来那个 session,也不启动来源的 CLI,只是离线读一遍本机记录,整理出一份能带走的交接文档,扔给新 agent 接着干。 目前已经做到 8 个来源对 8 个目的端全覆盖。 想试的话,一条命令 pipx install portable-resume 就够了。
想同时给大陆直连、海外也能打开的项目站,别再死磕 Vercel / github.io 了。
我试下来最省事的是 Cloudflare Pages:域名长这样 xxxx.pages.dev。 节点常在香港,大陆直连多半能上;海外也稳。免费,还能绑 GitHub 自动部署。 Vercel、Railway、OnRender、GitHub Pages、腾讯 EdgeOne、自己买域名建站我都试过。 要「两边都能连 + 省钱 + 上手快」,还是 CF Pages。 不是最炫,是最省心。 懒人玩法:
每个新 session,Agent 都像失忆:项目背景、你的偏好、上次约定,全得重讲一遍。Token 就这么烧掉。
Obsidian Mind 是个开源小工具:给 Claude Code / Gemini 一类 Agent 加跨会话持久记忆。不用注册。 思路简单——记忆落在本地/你可控的结构里,而不是每次冷启动从零解释。 冷启动痛的人值得看一眼。
用 ChatGPT Sites 搭一个带登录的私有文件 Host
上一篇写了 ChatGPT Sites 怎么快速发一个网站([链接](https://x.com/iluciddreaming/status/2078313581851083183))。 这篇讲一个更偏工程向的玩法:**用 Sites 搭一个带登录的私有文件 Host**——可以上传、下载、浏览文件,也能用脚本把本地目录同步到站点。重点不是空间有多大,而是 Sites 把 **Workers +
玩 Multi-Agent 大半年,我仍坚持:
LLM 可替换;Architecture 可替换;Harness 可替换;IDE / Skill / Knowledge 都可替换。 值得长期养的,是 Identity / Memory——你是谁、做过什么、偏好什么。 工程上也一样:记得住上下文,才谈得上持续协作。
腾讯 WorkBuddy 产品负责人汪晟杰说:
每个 App 背后都该有对应 CLI;有了 CLI,大模型才能直接调。CLI 不是目的——是为了让模型理解系统,调用时不必绕 GUI。 GUI 的颜色和按钮是给人看的。让 Agent 等页面加载、点按钮,是绕远路。命令行和结构化数据,对它直接得多。 入口若变成 Agent:人 ↔ Agent ↔ CLI ↔ 软件。
AI Agent 开源教科书,GitHub Trending 日榜第一,单日 +1700 星。
《深入理解 AI Agent》:记忆、RAG、MCP、多 Agent、强化学习到 Coding Agent,附 PDF 和每章代码。 Python,学理工程并重。开发者建议收。
TLDR offline:让 Agent 直接画图。
离线 tldraw + skills + SDK,跟 Agent 画架构图、流程图。 不是再截一张草图——是画板本身可被 Agent 驱动。
用 Agent 在 LinkedIn 帮你找工作。
开源 linkedin-mcp-server:Chrome 扩展拿 session,Agent 直接搜岗位,还能改 headline 提高曝光。 自己架在本机,权限在你手里。 Headline 怎么写 LinkedIn 风,网上有 skill 可抄。
open-slide 的 Morph Transition 正式发布了。
以前 Keynote 的 Magic Move 最香:自动认前后页相同元件,做移动缩放转场,演示立刻专业一截。 现在跟 Agent 说一句「我要 Morph Transition」,内置 skill 就会教它怎么生成。 框架不是替代 Agent,是给投影片特效搭脚手架——Codex / Claude Code 照样驱动。 GitHub:https://github.com/1weiho/open-