OctoNews

笔记 · 技术和认知提升

大模型

技术和认知提升中与大模型相关的内容。 共 45 条。

Thread

NVIDIA 把 Agentic AI 拆成六门课

我翻了一遍路径 比「再看一个 Agent demo」有用 怎么搭 Agent 怎么做 Agentic RAG 怎么评测 怎么定制 怎么做更深的 Agent 最后一门直接讲更安全的自主 Agent 很多人卡在第一课的兴奋感里 真正分水岭往往在评测和安全 能跑起来和敢放出去 中间差一整段工程

Article

用 Modal 部署 Qwen3.8 27B:从 Endpoint 创建到本地调用的完整实战

如果只是在线体验模型,打开网页即可;但如果希望把模型接入自己的应用,就需要一个稳定、可鉴权的服务入口。 Endpoint 的价值在于: - 为模型提供统一的 API 地址 - 允许自己的应用通过 Token 调用 - 可以查看部署状态、GPU 配置和运行情况 - 能够通过 Quickstart 或代码示例快速接入 - 可以设置预算上限,避免测试时产生不可控费用 这次实战的目标,是把 Qwen3.8

Thread

8GB 显存到底能跑多大模型

别再靠感觉了 llmfit 扫一眼你的内存、CPU、显卡 按「能不能塞进去」「会不会卡死」「质量够不够」打分 我刚测过 27B 塞进 8GB 这种工具本该先跑一遍 再下载那十几个 G

Article

8GB 显存,能不能跑 27B?我用 RTX 3060 Ti 实测 Qwen3.8-27B

先说答案:能跑,但不算流畅。 我在一台 Windows 台式机上,用 RTX 3060 Ti 8GB 跑通了 Qwen3.8-27B。命令行生成速度约 1.7 tokens/s,本地 API 测到约 1.9 tokens/s。 这个结果适合技术验证、轻量问答和偶尔写作,不适合拿来做高频编码助手,更别说多人服务。 如果你也是 8GB 显存,最重要的不是照抄我的每个参数,而是先选对路线:**GGUF

这张图不是在比谁更聪明

是在比谁吐字更快 左边一坨 Qwen、Claude、Grok、Gemini 智力分差不多挤在一起 速度都还在几百 token 以内晃 右边单独一个点 GPT-5.6 Sol Ultrafast 标了 Cerebras 大约 750 token 每秒 聪明没被拉开 延迟被拉开了 做 agent 循环时 这比再涨两分智力更疼

Article

为什么 AI 时代还需要继续用 Anki

跟 ChatGPT 聊完,我会有种「这下懂了」的爽感 两周后再被问到同一个细节 脑子里经常只剩浆糊 模型讲得挺清楚 是我会忘 我现在的用法就一句 **AI 负责学得快** **Anki 负责忘得慢** 下载:[Anki](https://apps.ankiweb.net/) --- 我现在学东西,大量靠大模型 追问、举反例、当场考我 启动成本几乎为零 当场理解变强了 过一阵还是会忘 当场 quiz

想试本地大模型,别一上来乱下 70B。

我的起步顺序: 1. 先上 Qwen3.6 27B——手感/速度平衡 2. 觉得慢,再试 Qwen3.6 35B-A3B(MoE 路线更省) 3. 显存紧:Qwen3.5 9B 先把「能稳定跑、愿意天天用」做出来,再卷更大模型。本地玩的是工程,不是榜单。

Article

百度网盘 - 闲鱼 MCP 一键发布,让你有价值的资料变成持续赚钱的机器

你网盘里是不是也躺着几十个 G 的资料?真正卡住你上架闲鱼的,往往不是「有没有货」,而是那套重复劳动:翻文件夹找素材、下载到本地、开闲鱼网页填标题图价格、点发布——每一件新货都要重来一遍。 这套重复劳动,够格交给 Agent 做,你只需要最后点头确认。 今天讲的就是这条链路:**百度网盘 + 闲鱼 + Agent(MCP)**。 把网盘接成工具,把闲鱼接成工具,再串成「找资料 → 写介绍 → 打草

Thread

学大模型最缺的不是理论,是能跟着敲代码的教程——尤其还得是中文的。

dive-into-llms 刚好补上这个空:上海交大张倬胜团队出的 11 章实战课,每章配讲义 PDF 加可执行 Notebook,从微调、提示工程讲到 RLHF、多模态、GUI agent,连越狱攻击和 agent 安全这种进阶内容都覆盖了。 GitHub 44.9K star,今天单日涨 654,说明真有人在用。 全中文,边学边改代码,不需要去看大量英文论文。

Thread

想同时给大陆直连、海外也能打开的项目站,别再死磕 Vercel / github.io 了。

我试下来最省事的是 Cloudflare Pages:域名长这样 xxxx.pages.dev。 节点常在香港,大陆直连多半能上;海外也稳。免费,还能绑 GitHub 自动部署。 Vercel、Railway、OnRender、GitHub Pages、腾讯 EdgeOne、自己买域名建站我都试过。 要「两边都能连 + 省钱 + 上手快」,还是 CF Pages。 不是最炫,是最省心。 懒人玩法:

很多人以为美国 AI 核心只在 OpenAI 和 Anthropic。

我更看 Google。文本模型吃文字 token;世界大模型更吃视觉 token——数据量另一个量级,也更贴物理。 文本能服务的场景小于视觉理解;外挂多模态常常不划算。路线对了,榜会重排。

Article

用 ChatGPT Sites 搭一个带登录的私有文件 Host

上一篇写了 ChatGPT Sites 怎么快速发一个网站([链接](https://x.com/iluciddreaming/status/2078313581851083183))。 这篇讲一个更偏工程向的玩法:**用 Sites 搭一个带登录的私有文件 Host**——可以上传、下载、浏览文件,也能用脚本把本地目录同步到站点。重点不是空间有多大,而是 Sites 把 **Workers +

Thread

玩 Multi-Agent 大半年,我仍坚持:

LLM 可替换;Architecture 可替换;Harness 可替换;IDE / Skill / Knowledge 都可替换。 值得长期养的,是 Identity / Memory——你是谁、做过什么、偏好什么。 工程上也一样:记得住上下文,才谈得上持续协作。

Thread

Code review 最烦的,常常不是模型不会写。

是你只改一个 function,它仍把半个 monorepo 重读一遍——token 烧掉,判断还飘。 code-review-graph 先把函数、class、import、调用建成图,再摘出 blast radius。 README 例子:大 monorepo 可少读 2.7 万+ 文件,只留约 15 个必要文件;2900 文件增量重建可在约 2 秒内。 接在 agent 前面,省的是上下文噪

Thread

语音助理的四层架构:VAD → 语音识别 → LLM → 语音合成,这四层常常来自不同服务商。想换掉其中一家,往往得整组管线重写。

Hugging Face 开源了 speech-to-speech,把这四层模块化,让你像换零件一样替换其中一段。 • VAD、STT、LLM、TTS 各自都能替换,不绑死单一供应商 • 可以直接把 OpenAI Realtime API 换成本地版本,不用重写整套逻辑 • 所有模型都能在本地跑,语音数据不必离开自己的机器

Thread

微软为什么几乎没有参与基础大模型竞赛?

谷歌有 Gemini,Meta 有 Llama,字节有豆包,阿里有通义千问。 微软与其他巨头不同,它早就没有主人了。Satya Nadella 只是个打工的。 Carl Icahn 说过,美国 CEO 的选拔机制往往是「反达尔文」的——老好人缘好、不做争议性决策、安全听话。Ballmer 敢打大赌,Nadella 选择了最稳妥的路:投资 OpenAI。 从 Windows Phone、收购诺基亚,

这看起来比 FreeLLMAPI 还厉害,准备部署试试。

OmniRoute — 免费 AI 网关,TypeScript 编写,单一本地端点(/v1)聚合 237 个 AI 提供商,其中 90+ 有免费额度。 核心是 4 层自动回退(订阅 → API Key → 便宜 → 免费),毫秒切换,17 种路由策略,再用 RTK + Caveman 堆栈压缩省掉 15–95% 的 token。 能自动在免费额度的提供商之间切换,不用自己一个个试了。

微信真正厉害的,不是它突然拥有了一个大模型,而是它本来就拥有一个巨大的上下文宇宙。聊天记录告诉它你最近在关心什么,群聊告诉它你所在的关系圈,支付和小程序记录告诉它你真正做过什么,内容和订阅告诉它你长期偏好什么。这样一来,AI 不只是回答问题

微信真正厉害的,不是它突然拥有了一个大模型,而是它本来就拥有一个巨大的上下文宇宙。聊天记录告诉它你最近在关心什么,群聊告诉它你所在的关系圈,支付和小程序记录告诉它你真正做过什么,内容和订阅告诉它你长期偏好什么。这样一来,AI 不只是回答问题,而是能判断你此刻最可能想做什么,甚至比你自己还快一步。 上下文是什么?上下文就是存储!存储就是上下文!

Thread

video-use — 把粗剪素材丢进去,一句话描述想要什么,直接出 final mp4。11.2K ⭐

browser-use 团队新作。诀窍是 LLM 不逐帧看视频(那要烧 4500 万 token),改读转写文本 + 少量截图,省钱又准。 · 自动剪掉「嗯」「啊」口头禅和空白 · 每段自动调色,剪辑点加淡入淡出 · 自动烧录字幕、生成动画叠层 · 渲染后自我检查,有问题自动重剪 粗剪丢给 coding agent,这个方向值得关注。

Thread

中国开发者用 1 折甚至 5% 的价格买到 Claude token,而且多半是真的 Claude。

价差背后叫「中转站」——一台架在海外的 proxy,用「合法地区」账号替你转发 request,你付人民币走支付宝。 这门生意叫「一鱼三吃」: 第一吃:套利。批量注册新账号刷 $5 免费额度、收别人用不完的额度转手、钻企业折扣、把 $200 订阅切给多人共用,最黑的是直接用盗刷信用卡开账号。 第二吃:换模型。你选 Opus,它悄悄换成 Sonnet 或 Qwen,标签改回来,你看不出来。德国 CI

OpenAI 发了第一款自研 AI 芯片 Jalapeño,主打 LLM 推理。

早期测试 performance per watt 优于 SOTA,这类说法关键不在口号,在对比环境和 workload。是不是自家吹的,得等 technical report 才知道。 九个月 tape-out 确实快。官方说是模型加速了芯片设计;我更倾向另一个解释:目标 workload 就是 LLM inference,设计空间收,Broadcom 扛了大部分工程活。 从模型到芯片到云,fu

Thread

想搭知识库?GitHub 上这几个开源工具分工很清晰:

FastGPT:基于 LLM 的知识库平台,工作流、问答、数据集管理完整,适合企业快速搭建。 LLM Wiki:桌面端文件整理成互联知识库,适合个人笔记和本地查阅。 llm-wiki-agent:扔资料让 AI 自动读、整理、维护,像会自己更新的 wiki。 OpenKB:轻量开源知识库,适合先跑最小可用版本。 不同需求选不同工具。 项目链接: FastGPT: https://github.co

腾讯AI开发面试题看下来,有点意思。

他们最看重的不是大模型能写多漂亮的回答,而是: - 怎么解决Token限制和长期记忆问题 - 用什么架构让Agent可控(LangGraph、FSM、ReAct) - 工具怎么Skill化、复用 - 加上扎实的后端基础(设计模式、高可用) 一句话:现在大厂要的是既懂大模型特性,又能把系统真正跑起来的工程师。 只会调API的,越来越没竞争力了。