OctoNews

笔记

技术和认知提升

对技术趋势与架构选择的判断,以及思维方式上的长进。 共 305 条。

AI 不是一个东西,它是一个能力演进的过程。

60 秒理解 AI 的 4 个阶段: ① 大脑(LLM):思考 + 写作,但只知道训练数据里的东西 ② 大脑 + 书(RAG):思考 + 实时检索,知识不再过期 ③ 大脑 + 工具(Agent):思考 + 行动,能操作文件、浏览器、API ④ 大脑 + 团队(Multi-Agent):多个 Agent 协作,并行完成复杂任务

Cloudflare 出了个新工具:Drop。

部署静态网站只剩一个动作——把文件夹拖进浏览器,几秒自动部署到全球边缘网络,连登录都不需要。 默认存活 60 分钟,够你分享 demo 或验证原型。想永久保留就点 Claim 绑定账号。 不用 Git,不用 CI,不用任何配置。拖进去就完了。

辭上了复利之后,生活就变了。

每天背50个单词,一年增加3000个词汇量。 每月读三本书,一年可以70本。 定期定额投资,慢慢累积复利。 持续创作,在技法和概念上不断进步。 每件事单独看都很平常,一直坚持下来后就得到结果了。 复利不需要你做什么大事,就是每天那些看起来琐碎的小事。

Marketing 这门学科的核心逻辑:

人的思维是可以被滲透、被塑造、被教育的。 所以这门学科堆称一门邪术。 掌控它的人不追鲁,不就范,只是知道“想要认知被塑造」是怎么运作的。

OpenAI 发布了 GPT-Live,用「全双工」架构把语音模型重做了一遍。

以前语音 AI 的三大痛点: ① 三个模型接力(转文字→想答案→再念出来),慢且生硬 ② 得等你完全说完才答 ③ 背景杂音一来就被当成“说完了”,直接抢话 GPT-Live 的全双工架构:端到端语音处理,不再中转文字,也不需要等你说完。 语音 AI 的体验问题终于开始被认真对待了。

Claude Code vs Codex 差在哪?

Claude Code: — 资深工程师助手 — 每天改很多文件、重构大型项目 — 习惯用 Terminal Codex: — 全方位 AI 开发工具 — 与 ChatGPT 生态整合 — 非工程师也能用 价格都是约 $20/月 一句话: 工程师深度开发 → Claude Code 想快速上手 → Codex

Thread

微软为什么几乎没有参与基础大模型竞赛?

谷歌有 Gemini,Meta 有 Llama,字节有豆包,阿里有通义千问。 微软与其他巨头不同,它早就没有主人了。Satya Nadella 只是个打工的。 Carl Icahn 说过,美国 CEO 的选拔机制往往是「反达尔文」的——老好人缘好、不做争议性决策、安全听话。Ballmer 敢打大赌,Nadella 选择了最稳妥的路:投资 OpenAI。 从 Windows Phone、收购诺基亚,

Gemma 4 现在是真正开源了,Apache 2.0 授权。

免费下载、可修改、可商用,甲还能离线跑在自己电脑和手机上。 支持 140 种语言,2B/4B 小模型连手机 GPU 都跑得动。 开发者:把 AI 嵌入自己的 App,不用付月费,数据完全自己管。 普通用户:下载到设备,离线处理图表、语音、视频,超私密。 和 Gemini 最大的区别:Gemma 4 是真开源,不是封闭的免费API。

6 家 NVIDIA 的竞争对手——不同公司、不同国家、不同架构——对 CUDA 的问题收敛到了同一个答案。

Tenstorrent、Cerebras、Trainium、TPU、SambaNova、Furiosa,六家不约而同,全部捨弃硬件快取,改用软件管理的 SRAM 架构。 原因很简单:AI 的访问模式规律到可以预测,投机式快取变成浪费,亲手安排好数据落点, cache miss 就不会发生。 这是 AI 芯片替代 NVIDIA 的路上,一条共同的技术斜坡。

别再无脑吹中国大模型了。

我承认,它们最大的优势是价格,甚至能威胁美国 AI 巨头。 但别动不动就吹成「全面超越」。 以 DeepSeek 为例,官方云端 API 到现在都没有提供图像输入。你可以说它有视觉模型,但一般开发者通过官方 API 根本用不了。 很多模型跑分很漂亮,真正放到 Coding、Agent、Tool Use、长流程工作流,差距还是在。 不卖你 1/6 的价格,还想要什么? 跑分没输过,实战没赢过。

TensorRT-LLM、FlashAttention 都已经 production level 了,学 CUDA 还有什么价值?

答案:价值依然很大,只是角色不同。 大部分 AI 工程师不需要重写 CUDA kernel,但要懂 GPU 原理—— 才能在这些场景做出正确决策: • 用什么规格的 GPU? • 部署 7B 还是 70B? • Chatbot 还是 RAG 架构? • 单用户还是多人并发? 这些直接影响 Batch Size、KV Cache、Precision、Continuous Batching 怎么配。

Article

ChatGPT Work是什么?新手完整教学:做什么、怎么用、风险在哪

ChatGPT Work 是 OpenAI 推出的工作型 AI Agent,和普通 ChatGPT 最大的区别是:它不只回答你的问题,而是能帮你完成一份完整的工作成果。 会议记录整理成待办清单、多份文件整理成简报大纲、表格分析后出具报告——这些都是它能做的事。 但它也有明确限制,不是什么都能交给它处理。本文用新手能看懂的方式说清楚:ChatGPT Work 能做什么、新手怎么开始用,以及最容易忽略

Thread

黄仁勋在 Stanford 被学生问:在零亿美元市场里待了十几年,信念从哪里来?

他的答案是一个英伟达内部缩写:EOIFS Early Indicators of Future Success——未来成功的早期指标。 他说:「很多人说 KPI 是毛利率。毛利率是结果。你要找的是结果出现之前的正向信号,越早越好。」 他的纪律是把两件事分开:赚不赚钱是结果,做的事对不对是证据。 他找的早期信号长这样: • 解决了过去解不了的问题——市场还没出现,但重要的问题在被一个个解掉 • 工作

Thread

Indie hacker 必收藏:free for dev

收集了几百个开发工具的免费额度(Free Tier),分类清晰: • 云服务:AWS、GCP、Cloudflare • 数据库:Supabase、Neon、MongoDB Atlas • 部署:Vercel、Netlify、Railway • 监控:Sentry、Better Stack • AI 工具、向量数据库、LLM 监控 低成本验证想法,从这里开始。

有人在 GitHub 做了一套免费 AI 课程。

不是理论,是完整实战系统: Week 1 → Docker + FastAPI + 数据库 Week 2 → 自动化数据管线 Week 3 → 自己搭搜索引擎(BM25) Week 4 → 混合搜索(语义+关键词) Week 5 → 完整 RAG 系统 Week 6 → 生产级(缓存+监控) Week 7 → 用 LangGraph 做 Agentic AI 不是「学 AI」,是动手做出来。

腾讯开源 Hy3 preview。

295B 总参数,但每次只激活 21B;上下文拉到 256K。 重点不是参数表,而是它把代码、推理、Agent 能力放在同一条线上。 国产开源模型正在从“能聊天”往“能干活”卷。 接下来比的不是谁会背答案,而是谁能长期执行任务。

Thread

一个待过 Scale、OpenAI、Google 的工程师写了篇职涯建议

里面一句话让我停了很久: 「AI 只会变强在你写得出评分标准的事情上」 什么意思? 只要一件事有标准答案、能打分——AI 就会越练越强,最终超过你。 帮你改邮件语气、翻译、修代码、排版——它超会。因为对错很明确。 但这几种它只能站旁边看你决定: 这笔钱投产品还是投营销 这个合作该不该答应 今天最该花力气的是哪一题 它可以列优缺点,但它没真的活过、没亏过钱、没被坑过。 最后那一下要不要赌,还是你自己

2026年AI从业者的知识鄙视链要变了。

光会调 API 不够了。这8个方向值得重点投入: Agentic Loops、MCP、MultiAgent System、AI Gateway Inference Economy、Evals、Guardrails、Observability 有个规律:前4个是"搭什么",后4个是"怎么不翻车"。 只盯架构,不懂 Evals 和 Observability,系统上线就是盲飞。

2026年下半年,这8个AI概念值得重点关注:

- Agentic Loops(智能体循环) - MCP(模型上下文协议) - Subagents & MultiAgent System(多智能体系统) - AI Gateway(AI 网关) - Inference Economy(推理经济) - Evals(评估体系) - Guardrails(护栏机制) - Observability(可观测性)

这看起来比 FreeLLMAPI 还厉害,准备部署试试。

OmniRoute — 免费 AI 网关,TypeScript 编写,单一本地端点(/v1)聚合 237 个 AI 提供商,其中 90+ 有免费额度。 核心是 4 层自动回退(订阅 → API Key → 便宜 → 免费),毫秒切换,17 种路由策略,再用 RTK + Caveman 堆栈压缩省掉 15–95% 的 token。 能自动在免费额度的提供商之间切换,不用自己一个个试了。

video-use 是 Browser Use 团队推出的开源工具,让 Claude Code、Codex、Cursor 等 AI Coding Agent 具备视频剪辑能力。

它不是要取代 Premiere 或 CapCut,而是通过 prompt + 工具脚本的工作流,让 LLM 先读取视频转写文本,在需要时调用可视化工具辅助判断,最后通过 ffmpeg 完成剪辑。 核心价值:让 AI 不必真的「看懂」整支视频,而是通过文字、时间轴与工具协作,完成更精准可控的剪辑。

Thread

一篇文章标题很反直觉:「Doing nothing at work」(在工作时什么都不做)

核心观点:工程师一整年的绩效,往往由少数几个关键时刻决定。可能是一次救了产品的调试、一个让团队少走半年弯路的架构决策。这些关键时刻没法排进日历,来的时候你要有余裕才接得住。 如果平常就把自己逼到100%满载,等真正的关键时刻来临,反而没力气把它做好。 作者建议刻意练习「什么都不做」,让自己维持在80%使用率。

真正有远见的人,都开始培养这 8 种能力

1. 不要只学会工作,更要学会思考。工作可以带来收入,思考才能创造机会,认知越高,选择越多。 2. 不要只追求速度,更要追求方向。方向正确,一小步也是进步;方向错了,再努力也只是消耗自己。 3. 学会管理时间,而不是被时间管理。把时间留给学习、健康、重要的人,以及能创造未来的事情。 4. 培养解决问题的能力。每解决一个问题,你的能力就提升一分;每创造一份价值,你的机会也会增加一分。 5. 建立值得

2 分钟搭出一个能打电话的 AI,xAI 刚发了 Voice Agent Builder

以前做语音客服要拼三块:语音转文字 + 大模型 + 文字转语音,三个厂商,三倍延迟,三倍出故障的机会。 这个工具是端到端「语音对语音」,和 Grok Voice 紧耦合,不是拼装货。 跑分上 Grok Voice 在 τ-voice Bench 拿 67.3%,Gemini Flash Live 43.8%,GPT Realtime 35.3%。 怎么用:写段大白话描述通话流程 → 挂知识库 →