NVIDIA 把 Agentic AI 拆成六门课
我翻了一遍路径 比「再看一个 Agent demo」有用 怎么搭 Agent 怎么做 Agentic RAG 怎么评测 怎么定制 怎么做更深的 Agent 最后一门直接讲更安全的自主 Agent 很多人卡在第一课的兴奋感里 真正分水岭往往在评测和安全 能跑起来和敢放出去 中间差一整段工程
用 Modal 部署 Qwen3.8 27B:从 Endpoint 创建到本地调用的完整实战
如果只是在线体验模型,打开网页即可;但如果希望把模型接入自己的应用,就需要一个稳定、可鉴权的服务入口。 Endpoint 的价值在于: - 为模型提供统一的 API 地址 - 允许自己的应用通过 Token 调用 - 可以查看部署状态、GPU 配置和运行情况 - 能够通过 Quickstart 或代码示例快速接入 - 可以设置预算上限,避免测试时产生不可控费用 这次实战的目标,是把 Qwen3.8
8GB 显存到底能跑多大模型
别再靠感觉了 llmfit 扫一眼你的内存、CPU、显卡 按「能不能塞进去」「会不会卡死」「质量够不够」打分 我刚测过 27B 塞进 8GB 这种工具本该先跑一遍 再下载那十几个 G
8GB 显存,能不能跑 27B?我用 RTX 3060 Ti 实测 Qwen3.8-27B
先说答案:能跑,但不算流畅。 我在一台 Windows 台式机上,用 RTX 3060 Ti 8GB 跑通了 Qwen3.8-27B。命令行生成速度约 1.7 tokens/s,本地 API 测到约 1.9 tokens/s。 这个结果适合技术验证、轻量问答和偶尔写作,不适合拿来做高频编码助手,更别说多人服务。 如果你也是 8GB 显存,最重要的不是照抄我的每个参数,而是先选对路线:**GGUF
这张图不是在比谁更聪明
是在比谁吐字更快 左边一坨 Qwen、Claude、Grok、Gemini 智力分差不多挤在一起 速度都还在几百 token 以内晃 右边单独一个点 GPT-5.6 Sol Ultrafast 标了 Cerebras 大约 750 token 每秒 聪明没被拉开 延迟被拉开了 做 agent 循环时 这比再涨两分智力更疼
为什么 AI 时代还需要继续用 Anki
跟 ChatGPT 聊完,我会有种「这下懂了」的爽感 两周后再被问到同一个细节 脑子里经常只剩浆糊 模型讲得挺清楚 是我会忘 我现在的用法就一句 **AI 负责学得快** **Anki 负责忘得慢** 下载:[Anki](https://apps.ankiweb.net/) --- 我现在学东西,大量靠大模型 追问、举反例、当场考我 启动成本几乎为零 当场理解变强了 过一阵还是会忘 当场 quiz
想试本地大模型,别一上来乱下 70B。
我的起步顺序: 1. 先上 Qwen3.6 27B——手感/速度平衡 2. 觉得慢,再试 Qwen3.6 35B-A3B(MoE 路线更省) 3. 显存紧:Qwen3.5 9B 先把「能稳定跑、愿意天天用」做出来,再卷更大模型。本地玩的是工程,不是榜单。
百度网盘 - 闲鱼 MCP 一键发布,让你有价值的资料变成持续赚钱的机器
你网盘里是不是也躺着几十个 G 的资料?真正卡住你上架闲鱼的,往往不是「有没有货」,而是那套重复劳动:翻文件夹找素材、下载到本地、开闲鱼网页填标题图价格、点发布——每一件新货都要重来一遍。 这套重复劳动,够格交给 Agent 做,你只需要最后点头确认。 今天讲的就是这条链路:**百度网盘 + 闲鱼 + Agent(MCP)**。 把网盘接成工具,把闲鱼接成工具,再串成「找资料 → 写介绍 → 打草
学大模型最缺的不是理论,是能跟着敲代码的教程——尤其还得是中文的。
dive-into-llms 刚好补上这个空:上海交大张倬胜团队出的 11 章实战课,每章配讲义 PDF 加可执行 Notebook,从微调、提示工程讲到 RLHF、多模态、GUI agent,连越狱攻击和 agent 安全这种进阶内容都覆盖了。 GitHub 44.9K star,今天单日涨 654,说明真有人在用。 全中文,边学边改代码,不需要去看大量英文论文。
想同时给大陆直连、海外也能打开的项目站,别再死磕 Vercel / github.io 了。
我试下来最省事的是 Cloudflare Pages:域名长这样 xxxx.pages.dev。 节点常在香港,大陆直连多半能上;海外也稳。免费,还能绑 GitHub 自动部署。 Vercel、Railway、OnRender、GitHub Pages、腾讯 EdgeOne、自己买域名建站我都试过。 要「两边都能连 + 省钱 + 上手快」,还是 CF Pages。 不是最炫,是最省心。 懒人玩法:
很多人以为美国 AI 核心只在 OpenAI 和 Anthropic。
我更看 Google。文本模型吃文字 token;世界大模型更吃视觉 token——数据量另一个量级,也更贴物理。 文本能服务的场景小于视觉理解;外挂多模态常常不划算。路线对了,榜会重排。
用 ChatGPT Sites 搭一个带登录的私有文件 Host
上一篇写了 ChatGPT Sites 怎么快速发一个网站([链接](https://x.com/iluciddreaming/status/2078313581851083183))。 这篇讲一个更偏工程向的玩法:**用 Sites 搭一个带登录的私有文件 Host**——可以上传、下载、浏览文件,也能用脚本把本地目录同步到站点。重点不是空间有多大,而是 Sites 把 **Workers +
玩 Multi-Agent 大半年,我仍坚持:
LLM 可替换;Architecture 可替换;Harness 可替换;IDE / Skill / Knowledge 都可替换。 值得长期养的,是 Identity / Memory——你是谁、做过什么、偏好什么。 工程上也一样:记得住上下文,才谈得上持续协作。
Code review 最烦的,常常不是模型不会写。
是你只改一个 function,它仍把半个 monorepo 重读一遍——token 烧掉,判断还飘。 code-review-graph 先把函数、class、import、调用建成图,再摘出 blast radius。 README 例子:大 monorepo 可少读 2.7 万+ 文件,只留约 15 个必要文件;2900 文件增量重建可在约 2 秒内。 接在 agent 前面,省的是上下文噪
LangWatch:给 LLM 应用加一层眼睛。
开源,主要做两件事:分析你的 LLM 使用情况,帮你优化 prompt。对做 AI 产品的人来说,这类工具基本上是必备的——没有它,出了问题不知道从哪查起。 3.4k Star,还在更新。
北京一家饺子馆有自己的 Skill:金谷园饺子馆.Skill
能排队、取号、看进度。 线下去吃完,还能凭桌号在前台领 Token。 营销很聪明。更值得想的是:Skill 很可能蚕食小型 App / 小程序的入口——大模型 Agent 会变成新的流量前台。
Google 的 skills 项目:让 AI 机器人拥有「手脑协调、在物理世界干活」的底层技能库。
以居大模型只会写代码写文章,你叫它去厨房「把杯子拿过来」,它就彻底瞎了。 现在大模型只要下达 Skills.Pick(cup),底层框架自动计算运动轨迹,让机械手臂就像真人一样平滑地把杯子拿起来。
语音助理的四层架构:VAD → 语音识别 → LLM → 语音合成,这四层常常来自不同服务商。想换掉其中一家,往往得整组管线重写。
Hugging Face 开源了 speech-to-speech,把这四层模块化,让你像换零件一样替换其中一段。 • VAD、STT、LLM、TTS 各自都能替换,不绑死单一供应商 • 可以直接把 OpenAI Realtime API 换成本地版本,不用重写整套逻辑 • 所有模型都能在本地跑,语音数据不必离开自己的机器
微软为什么几乎没有参与基础大模型竞赛?
谷歌有 Gemini,Meta 有 Llama,字节有豆包,阿里有通义千问。 微软与其他巨头不同,它早就没有主人了。Satya Nadella 只是个打工的。 Carl Icahn 说过,美国 CEO 的选拔机制往往是「反达尔文」的——老好人缘好、不做争议性决策、安全听话。Ballmer 敢打大赌,Nadella 选择了最稳妥的路:投资 OpenAI。 从 Windows Phone、收购诺基亚,
Meta 正式推出 Muse Spark 1.1,重点不是聊天,而是 agentic workflow、电脑操作、工具使用、写代码。
根据 Alexandr Wang 的说法,Spark 1.1 在多个 agentic 评测中已可与 GPT-5.5、Claude Opus 4.8 放在同一级别比较。 Spark 1.1 在 MCP Atlas、Finance Agent v2 等领先;但 SWE-Bench Pro、DeepSWE 等纯编码项目 Opus 4.8 或 GPT-5.5 仍领先。更准确的说法:Meta 终于有了一个可
GPT-5.6 Sol 现在跑在 Cerebras 的「一整片晶圆当一颗芯片」硬件上。
速度:每秒 750 token。 普通 GPU:每秒 40–12 0。 差距:10 倍。 4000 token 的输出,GPU 要等一分钟,Cerebras 大约 6 秒。 对做 AI agent 的人最有感:实时语音、实时 coding 的可行边界往前移了。 你用的 agent ,最卡的是不是它慢慢吐字那段?
这看起来比 FreeLLMAPI 还厉害,准备部署试试。
OmniRoute — 免费 AI 网关,TypeScript 编写,单一本地端点(/v1)聚合 237 个 AI 提供商,其中 90+ 有免费额度。 核心是 4 层自动回退(订阅 → API Key → 便宜 → 免费),毫秒切换,17 种路由策略,再用 RTK + Caveman 堆栈压缩省掉 15–95% 的 token。 能自动在免费额度的提供商之间切换,不用自己一个个试了。
微信真正厉害的,不是它突然拥有了一个大模型,而是它本来就拥有一个巨大的上下文宇宙。聊天记录告诉它你最近在关心什么,群聊告诉它你所在的关系圈,支付和小程序记录告诉它你真正做过什么,内容和订阅告诉它你长期偏好什么。这样一来,AI 不只是回答问题
微信真正厉害的,不是它突然拥有了一个大模型,而是它本来就拥有一个巨大的上下文宇宙。聊天记录告诉它你最近在关心什么,群聊告诉它你所在的关系圈,支付和小程序记录告诉它你真正做过什么,内容和订阅告诉它你长期偏好什么。这样一来,AI 不只是回答问题,而是能判断你此刻最可能想做什么,甚至比你自己还快一步。 上下文是什么?上下文就是存储!存储就是上下文!
video-use — 把粗剪素材丢进去,一句话描述想要什么,直接出 final mp4。11.2K ⭐
browser-use 团队新作。诀窍是 LLM 不逐帧看视频(那要烧 4500 万 token),改读转写文本 + 少量截图,省钱又准。 · 自动剪掉「嗯」「啊」口头禅和空白 · 每段自动调色,剪辑点加淡入淡出 · 自动烧录字幕、生成动画叠层 · 渲染后自我检查,有问题自动重剪 粗剪丢给 coding agent,这个方向值得关注。
中国开发者用 1 折甚至 5% 的价格买到 Claude token,而且多半是真的 Claude。
价差背后叫「中转站」——一台架在海外的 proxy,用「合法地区」账号替你转发 request,你付人民币走支付宝。 这门生意叫「一鱼三吃」: 第一吃:套利。批量注册新账号刷 $5 免费额度、收别人用不完的额度转手、钻企业折扣、把 $200 订阅切给多人共用,最黑的是直接用盗刷信用卡开账号。 第二吃:换模型。你选 Opus,它悄悄换成 Sonnet 或 Qwen,标签改回来,你看不出来。德国 CI
做手机 GUI 自动化的很多,但大多数在长任务上会忘事。
快手出了 MemGUI-Agent,核心是主动上下文管理: 主动决定记什么、忘什么,不是被动等上下文溢出。 这才是长时域 Agent 真正难的地方。
OpenAI 发了第一款自研 AI 芯片 Jalapeño,主打 LLM 推理。
早期测试 performance per watt 优于 SOTA,这类说法关键不在口号,在对比环境和 workload。是不是自家吹的,得等 technical report 才知道。 九个月 tape-out 确实快。官方说是模型加速了芯片设计;我更倾向另一个解释:目标 workload 就是 LLM inference,设计空间收,Broadcom 扛了大部分工程活。 从模型到芯片到云,fu
想搭知识库?GitHub 上这几个开源工具分工很清晰:
FastGPT:基于 LLM 的知识库平台,工作流、问答、数据集管理完整,适合企业快速搭建。 LLM Wiki:桌面端文件整理成互联知识库,适合个人笔记和本地查阅。 llm-wiki-agent:扔资料让 AI 自动读、整理、维护,像会自己更新的 wiki。 OpenKB:轻量开源知识库,适合先跑最小可用版本。 不同需求选不同工具。 项目链接: FastGPT: https://github.co
薅羊毛机会。 DeepSeek V4 Flash 通过 OpenModel 限免,截止 6月28日:
薅羊毛机会。 DeepSeek V4 Flash 通过 OpenModel 限免,截止 6月28日: - 1M token 上下文 - 支持图像输入 + Agentic 任务 - 生成速度 100-127 tokens/s - 登录即得 API key 还有 6 天,去拿。
腾讯AI开发面试题看下来,有点意思。
他们最看重的不是大模型能写多漂亮的回答,而是: - 怎么解决Token限制和长期记忆问题 - 用什么架构让Agent可控(LangGraph、FSM、ReAct) - 工具怎么Skill化、复用 - 加上扎实的后端基础(设计模式、高可用) 一句话:现在大厂要的是既懂大模型特性,又能把系统真正跑起来的工程师。 只会调API的,越来越没竞争力了。