NVIDIA 把 Agentic AI 拆成六门课
我翻了一遍路径 比「再看一个 Agent demo」有用 怎么搭 Agent 怎么做 Agentic RAG 怎么评测 怎么定制 怎么做更深的 Agent 最后一门直接讲更安全的自主 Agent 很多人卡在第一课的兴奋感里 真正分水岭往往在评测和安全 能跑起来和敢放出去 中间差一整段工程
同一个概念 对小孩和对经理讲
同一个概念 对小孩和对经理讲 本该是两篇东西 我最近看到一个 Claude Code Skill 叫 ELI5 你先指定听众是谁 它再改术语密度和比喻 小孩少塞黑话 工程师保留正确术语 对 Manager 改讲成本、结果、风险 作者拿它跟原生 Claude 同题对打 ELI5 大约八成命中 原生掉到四成左右 我自己读 API、Agent 架构时最烦的 就是解释永远默认「懂的人」 这个 Skill
用 Modal 部署 Qwen3.8 27B:从 Endpoint 创建到本地调用的完整实战
如果只是在线体验模型,打开网页即可;但如果希望把模型接入自己的应用,就需要一个稳定、可鉴权的服务入口。 Endpoint 的价值在于: - 为模型提供统一的 API 地址 - 允许自己的应用通过 Token 调用 - 可以查看部署状态、GPU 配置和运行情况 - 能够通过 Quickstart 或代码示例快速接入 - 可以设置预算上限,避免测试时产生不可控费用 这次实战的目标,是把 Qwen3.8
七夕到了,恋爱中学会这 11 个技能,谁都招架不住。
1. 上下文压缩 2. 长期记忆检索 3. Function Calling 4. MCP 工具调用 5. 多模态理解 6. Agent 自主规划 7. RAG 检索增强 8. Structured Output 9. Computer Use 10. 递归自我改进 11. v我50
Claude Code 做到一半关掉
同一目录打开 Codex 不用再解释架构、踩过的坑、没答完的问题 ai-memory 给 coding agent 做长期记忆 会话结束写成 wiki 下一个 agent 先读交接 换模型不难 难的是上下文每次归零
8GB 显存到底能跑多大模型
别再靠感觉了 llmfit 扫一眼你的内存、CPU、显卡 按「能不能塞进去」「会不会卡死」「质量够不够」打分 我刚测过 27B 塞进 8GB 这种工具本该先跑一遍 再下载那十几个 G
Cloudflare 上又多了个能直接部署的邮件工作台:HQBase。
不是又一个 SMTP 客户端,而是多域名、收发加 AI 操作的管理工作台,存储用 D1 和 R2。跟官方 Agent Inbox 同赛道,开源可自托管。 想把「收信→处理」收进自己基建、少依赖第三方收件箱面板的,值得收一下。
创业栈很大一块能先按 0 美元搭起来
不是那种七天试用 是 Cloudflare、Oracle、Supabase、Vercel、GitHub 的真免费档 下面只写我读完觉得能上手的 Cloudflare 域名 DNS、CDN、SSL、抗 DDoS 免费 对象存储用 R2 10 GB-月 100 万 Class A、1000 万 Class B 出站到公网不计费 图、PDF、上传文件够 MVP 用 Oracle Cloud Always
问 AI 要架构图
回来永远是那套圆角方块 丢进 slides 就格格不入 diagram-design 装进 Claude Code 出的是带你品牌色的 HTML 和 SVG 架构、时序、泳道、甘特、2x2 都能画 扫一遍官网抽配色字体 离线单个文件打开 1.7 万星 一天涨三千多 说明这个痒点不是我一个人有
8GB 显存,能不能跑 27B?我用 RTX 3060 Ti 实测 Qwen3.8-27B
先说答案:能跑,但不算流畅。 我在一台 Windows 台式机上,用 RTX 3060 Ti 8GB 跑通了 Qwen3.8-27B。命令行生成速度约 1.7 tokens/s,本地 API 测到约 1.9 tokens/s。 这个结果适合技术验证、轻量问答和偶尔写作,不适合拿来做高频编码助手,更别说多人服务。 如果你也是 8GB 显存,最重要的不是照抄我的每个参数,而是先选对路线:**GGUF
这张图不是在比谁更聪明
是在比谁吐字更快 左边一坨 Qwen、Claude、Grok、Gemini 智力分差不多挤在一起 速度都还在几百 token 以内晃 右边单独一个点 GPT-5.6 Sol Ultrafast 标了 Cerebras 大约 750 token 每秒 聪明没被拉开 延迟被拉开了 做 agent 循环时 这比再涨两分智力更疼
三家赔钱/暴跌的公司
Lululemon、PayPal、Adobe 行业完全不同 共同点很脏: 高层先出事,数字才出事 Lululemon:折扣训练顾客「不打折不买」 溢价品牌一旦靠砍价续命 后面通常是董事会与 CEO 动荡 PayPal:黄灯亮一季 管理层怪宏观,同业却不喊苦 有人说:如果只有你被景气打,那大概不是景气 Adobe 最反直觉: 营收毛利订阅都没坏 AI 还在涨 股价却砍掉一大截 市场投的是「三年后还在
有人用 6 万美金堆 Mac Mini
搭了个迷你算力库 接 AI 公司的微调和标注 号称月入 2 万刀 差不多三个月回本 我关心的不是「你也去买一堆 Mini」 是模型侧业务正在外溢成: 算力租赁 数据标注 小规模微调托管 钱不一定在最炫的大模型公司 也可能在帮它们擦边干活的人手里 当然这是个例 回本曲线取决于订单密度 别当理财说明书
把架构图画成可拖、可分享的图
现在有个开源 skill 直接干这事 名字叫 draw-architecture 你丢一段文字描述的系统架构 它吐一张像 Figma 一样的 canvas: 拖拽、缩放、点元件隔离看 一键导出高清 PNG 丢进文档/PPT 还能把链接甩给同事在图上留言 平时跟团队对架构 最烦的不是「画不出来」 是图画完就死了 别人只能看截图 这种「可交互 + 可讨论」才是协作资产
人的认知大概能看成七层
茫然无知 表面认知 数据认知 结果认知 真相认知 知行合一 逻辑认知 大多数争论发生在第 2、3 层 却以为自己在第 7 层 真正拉开差距的 往往不是信息多少 是你停在哪一层还愿意往下挖
AI Agent 开始碰真机了。
不是模拟器 是真 iPhone、真 Android 看屏幕、点按钮、滑动、打字、开设置 开源项目 Mobile Harness 把眼睛和手接到手机上 本地也能跑,云设备也能规模化 Agent 上一阶段主要在写代码 这一阶段开始用你手机上的 App
AI 在大仓库改代码,最怕的不是不会写,是猜不清「这个函数到底被谁调用」。
code-graph-rag 把整个 monorepo 用 Tree-sitter 编成知识图谱 你的问题翻成 Cypher 去查图 改代码走 AST,先出 diff 再落盘 不是再 grep 赌运气 是让 Agent 先看清结构,再动手
红杉合伙人 Konstantine Buhler 在 AI Ascent 2026:我们正从工业革命,进入认知革命。
体力劳动几乎已被机器接管;下一步是 99.9% 的认知运算也可能交给网络。 预测一:技能会像铝一样变便宜。 电解前铝比金贵;电解后用来包糖果。 AI 像电解:顶尖技能从稀缺变可随时召唤。 预测二:外星设计(Alien Design)。 算法设计的天线/芯片可能丑到反直觉,但更优。 未来最优解不一定长得像人类习惯的样子。 预测三:会出现一门「AI 的热力学」。 现在还在 tinkering;几十年后
Cloudflare 把内部用的 Cloudflare OS 开源了。
定位:全员 AI 工作平台——每人 Agent + 工作区,内建公司知识、流程与 Skills;能出文档、简报,甚至可分享的小 App;Gatekeeper 管权限。 值得逐帧研究的是:把「公司操作系统」而不是「又一个聊天窗」当产品。 仓库在第二条。
30B 的 agent 模型,宣称 24GB VRAM 就能跑?
Muse Glimmer 开源了(Apache 2.0,权重在 Hugging Face):规划、工具调用、自检、失败恢复内建。 4-bit 量化把内存压到 20GB 以下,还留空间给 KV cache 与 drafter。 本周起可走 ollama / LM Studio / vLLM / sglang 等路径,也兼容 llama.cpp、MLX。 自架 agent 的门槛又下一截——真假强弱仍
做 AI Agent 最容易低估的,其实是聊天界面。
Streaming、重试、附件、代码块、Tool Call、用户确认……看起来只是 Chat UI,自己补一遍很耗时。 assistant-ui 把这些收成可组合的 React 组件,Tool Call 还能渲染成你自己的 UI。 更关键:不绑死后端,Vercel AI SDK、LangGraph、自建 API 都能接。 Vibe Coding 做 AI SaaS 时,我更想把时间花在 Agent
最近几条观察,压缩给你:
1. AI 求职风向:有人在用 hermes 路线做作品集(注意合规边界,别踩泄漏源码红线) 2. FED 相关岗位/话题今明年可能更热 3. AI 产品经理越来越要求懂技术:前沿、论文、最好自己做产品;强工作流,弱纯交互壳 4. 创始人三件套:对技术走向的直觉、快速迭代、专注一件事挖护城河——最忌有钱后到处开花 想找到这种团队:每天扫信息(X+newsletter+顶会+开源),盯顶级机构投资名
微软开源了 Skill Recorder:你操作一次,它录全过程,再让 GitHub Copilot 整理成「意图 + 步骤」,生成可复用的 Skill / Automation,给 Agent 之后直接跑。
一句话:录一次示范,Agent 以后自己做。 支持 macOS / Windows。 仓库在第二条。
前阵子大家疯抢 Mac mini,是为了自己养一只 AI Agent。
现在剧情可能反转:Gemini Spark 这类产品上来后,「自己架虾」可能变成少数派。 Spark 能做的事很日常:定时任务、监控主题、Gmail 触发、整理 Docs/Sheets、建 Skill、接 MCP。 以前 Agent 更像工程师玩具;现在大厂在把它做成普通人的生产力按钮。 小龙虾不一定失业,但「人人自建 runtime」这件事,正在变贵、变可选。 真正差距会变成:你知不知道该把什么
来逆风说一句 DeepSeek V4 Flash(本地 MXFP4 / Mac Studio M3 Ultra / oMLX)。
我不是聊天玩玩,是直接塞进 Codex 当主模型跑完整 agent。 会写代码,但很难稳稳收尾:修 A 坏 B,还得再拉别的模型 review。 固定 100 题粗测(本地量化,不代表 API): 编程 28/29 很好;完整集 75.5 一般;专案记忆 40% 差;工具流 66.7%、agent 规划 64.3% 不够稳;没图时还会捏造——这点危险。 结论:写 code 可以,当 Codex 主
普通人怎么变有钱?Codie Sanchez 那期播客的答案很扫兴:变闷。
真正攒下财富的人,不是一直追下一件事,而是把上一件事重复到本能。 重复带来复利;停一次,复利也停。 大脑爱新鲜(Shiny Object Syndrome),会把「不断开新坑」误当成进步。 其实每次换赛道,都是在把成功概率归零。 闷闷地赢,好过轰烈地输。
认知是判断力,心力是执行力。
而这两种东西,恰好,都是 AI 无法带来的。
你的技能文件存在公司代码库里,还是自己手里?
YC CEO Garry Tan 最近提了个挺尖锐的说法:个人积累的判断力和工作流,如果存在公司代码库里,会被无情榨取;存在自己掌控的仓库里,才是可携带、可复利的职业资产。 他把这套思路叫 Personal AGI——不是租外部大模型 API,而是搭建一个只属于你自己的智能体:读你的记忆,跑你的程序,随你使用越用越值钱。 四个支点:智能资产化、Markdown 即代码=生产力、Agent 行动能力
矽谷传统职位正在怎么改变?不是旧职位消失,是原本分开的职能在合并。
六条正在发生的转变: - Product Manager → 自己做原型、分析数据、用 AI 建工作流 - Frontend/全栈工程师 → 不只完成 ticket,要理解客户、对产品结果负责 - ML 工程师/数据科学家 → 从模型和 notebook,转向 Agent、RAG、部署、商业成果 - DevOps/SRE → 要懂 GPU、推理成本、模型服务、Agent orchestration
大多数人理解的 multi-agent,还停留在“多个 agent 轮流回答问题”。
Anthropic 这次开源的系统不是这个层级:员工管理、财务、采购,agent 之间互相分派任务,全程没有人介入决策链。 这才是 agentic workflow 该有的样子——不是给你一个能力更强的单个模型,是给一整套能自己运转的组织架构。值得花一小时拆解一遍。