OctoNews

笔记 · 技术和认知提升

大模型

技术和认知提升中与大模型相关的内容。 共 45 条。

Thread

想自己动手造一个 LLM 吗?

EveryonesLLM 是一个在 Google Colab 上从零手搓 nanoGPT 的完整填空教程。 30+ 章节 + 大量练习 + 张量可视化地图,带你一步步理解 Transformer 的每一个组件。 还有预训练、指令微调和 Vision LLM 内容 + 在线 Demo。 中文支持,强烈推荐给想真正搞懂原理的人!

Thread

最近很多人吐槽 Claude(尤其是新版)变了:

- 啰嗦 - 过度拒绝 - 态度越来越差 - 在复杂 coding 任务里经常「摆烂」 这不是个例,是很多重度用户共同的感受。 可能的原因: 1. Safety 训练越做越重,模型越来越「政治正确」和保守。 2. 长上下文 + Agent 场景下,模型为了「负责」开始过度解释、过度警告。 3. 公司为了对齐某些价值观,把「不冒犯」优先级提得太高。 有趣的是,这和用户实际需求产生了冲突。 用户想要的

Thread

1️⃣ 智谱的 GLM-5.2 最近全量开放了。

很多开发者已经在实际项目里用了,尤其是搭配 Claude Code、Cursor 这类工具。 反馈两极分化,但总体比预期好。 2️⃣ 积极的一面: - 编码能力追得很近,有些场景接近 Claude Sonnet 级别 - 中文理解和长文本表现不错 - 价格和 token 额度对国内用户更友好 - 很多人在试「Claude Code + GLM」混合使用,降本增效 3️⃣ 需要注意的问题: - 复杂

Thread

1 三个便宜模型凑在一起「开了个会」,把贵一倍的顶级模型打平了。

Fable 5 被限制访问?没关系。 OpenRouter 刚公布的实测:用一半价格,表现几乎一样。 这不是理论。 Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro Fusion 的做法是让它们并行接同一道题,各自带工具跑完。 然后 judge 模型把所有回答摊开,抓共识、矛盾、盲点,最后合成最终答案。 这个平价三人组 fused 之后,成绩和 Claude

Thread

1 一家牙膏公司悄悄把整个市场调研产业给干掉了,却几乎没人在讨论。

高露洁(Colgate)发表了一篇论文:只要让大模型(LLM)扮演消费者,就能以90%的准确率预测真实购买意愿。 这也太离谱了吧。 研究人员想了个办法,叫做语义相似度评分(Semantic Similarity Rating,SSR)。 他们不再让AI直接打分,而是让它角色扮演。 之后把这些想法和真实消费者的反馈做语义相似度对比。 结果:90%准确率 传统的市场调研(焦点小组、问卷、数据分析)可能

Thread

Claude Code token 救星!

最近看到一个开源工具叫 Graphify,有人在 Karpathy 许愿后 48 小时就把它做出来了😂 概念超级简单:把你的整个文件夹(代码、文档、PDF、图片)全部建成一个 knowledge graph。 不需要 vector database,不需要配置文件,直接指向文件夹就搞定了。 最猛的是,每次查询的 token 用量只需要原来的 1/71.5!对大型 codebase 特别有用。 对

Thread

TokenBar 1.0 正式发布 🎉

全新用 Swift 原生重写的 Mac 菜单栏 App: Liquid Glass 界面、可旋转的 3D 用量图表、更轻量、更省资源。 把 tokscale 的视图分类概念融入菜单栏, token 用量统计比 CodexBar 更细致。 追踪 Claude Code、Codex、Cursor、OpenCode 等 25+ AI coding agents,全部本机读取、零遥测。 安装: brew

Thread

Every 是 Dan Shipper 自己创的媒体和软件公司,从 2020 年 GPT-3 时代开始到现在 6 年多。

1/7 他们从 GPT-3 那刻起就把 AI 塞进每个工作流:写稿、编辑、客服、设计、营销、工程。Codex 和 Claude Code 是默认界面,新模型 alpha 阶段他们就先拿到。理论上这是「自动化到极致」最彻底的样本。 结果 2026-05-21 他发报告《After Automation》,标题直白:「我们什么都自动化了,但人却变多了」——从 4 人扩到 30 人。 几天后上 Lenn

什么是循环工程?!

当龙虾之父说:别再一个一个指令地催你的 agent,你应该设计一套会自动催它的循环。Claude Code 之父也几乎同时表示,自己早已不再亲手下指令,而是让循环自动去 prompt Claude、判断下一步,工作彻底变成了「写循环」。 循环工程的概念由此成形:把原来亲自写 Prompt 的你替换掉,改由系统来完成。循环本质上是一个递归目标,你只需要定义最终目的,AI 就会反复迭代,直到任务完成。

为什么用 Codex / Claude Code 的终端 CLI,而不是 GUI App?

真实优势: • 无缝融入现有终端工作流(git、tmux、编辑器),零上下文切换 • 支持 SSH、远程服务器、无头环境,GUI 做不到 • 纯键盘操作,迭代速度更快,视觉干扰更少 • 可脚本化、管道化,轻松自动化复杂任务 • 参数和上下文控制更精准 对重度开发者来说,CLI 才是真正放大生产力的工具。

Thread

今天折腾三台机器,累到不行。

跑的是 Qwen3.6 27B,context 全放 256k,测了几个组合: 1️⃣ RTX Pro 6000 + Intel B70(1200w) B70 跑 Gemma 4 12B,速度很快,还没仔细测 2️⃣ RTX 5060 Ti × 3(1000w / 48GB) 12-17 tok/s,跑 Claude Code CLI 体感够用,不卡顿 3️⃣ RTX 4080 + 5070

Thread

Claude Code Opus 4.8 同时推出了 Dynamic Workflows。

很多人不清楚它和 subagent、agent team 有什么区别。实测拆解一下。 之前的多 agent 方式: subagent = 主 agent 临时喊人帮忙 agent team = 几个 Claude Code 实例组成小团队,各自带上下文并行跑 但这两种本质还是"对话驱动"——下一步怎么做,每次都要让 agent 实时推理判断。 Workflow 不一样。 它会先写一份 workfl

DeepSeek-V3 的架构设计,是一份值得反复读的效率教材。

671B 总参数,推理时只激活 37B——靠的是这几个设计: 🧠 DeepSeekMoE:稀疏专家架构,共享专家 + 路由专家分离,负载更均衡 👁️ MLA(多头潜在注意力):低秩压缩 KV cache,显存占用大幅降低 ⚖️ 无辅助损失负载均衡:首次不靠额外 loss 项来平衡专家,性能损耗接近零 ⚡ MTP(多 token 预测):训练目标 + 推理加速两用,一个模块解决两个问题 🔢 F

小米 MiMo-V2-Flash 的架构设计,值得认真看一遍。

309B 总参数,推理时只激活 15B——靠的是这几个设计: 🧠 MoE(稀疏专家混合):256 个专家,每个 token 激活 8 个,算力利用率极高 👁️ 混合注意力:SWA + GA 按 5:1 交错,128-token 滑窗,KV cache 降低 6 倍 ⚡ MTP(多 token 预测):推理速度提升 2-3 倍,靠并行验证 draft token 实现 🎓 MOPD(多教师在线

我把所有 MCP 都删了。

GitHub 官方 MCP server 加载一次要 54,000 tokens。`gh --help` 是 562,模型训练数据里本来就有。 MCP 是给人包装的 JSON 官僚系统。agent 是进程,进程用 CLI 和 API 跟世界对话,几十年都这样。 Skills 30-50 tokens,触发时才展开。CLI battle-tested,可版控,可 debug。 这才是给 agent