OctoNews

笔记

技术和认知提升

对技术趋势与架构选择的判断,以及思维方式上的长进。 共 305 条。

Thread

最近 GitHub 上有个叫 Ponytail 的项目突然火了。

它不是新的 AI 编程工具,而是给 Claude Code、Cursor、Windsurf 这类 Agent 加了一个「懒惰资深工程师」人格。 核心就一句话: 最好的代码,是根本不用写的代码。 现在 AI 的通病是太爱写东西。一个小需求,它能给你整出一堆组件、抽象、配置和依赖。 真正有经验的工程师只会先问: • 标准库有没有? • 浏览器原生支不支持? • 已有依赖能不能解决? • 一行代码够不够

AI时代,打造一个有完整商业闭环的App,时间成本被压得很低。

一个App做了五页面,前后端完整架构,数据库用Supabase,金流接RevenueCat,会员系统用Apple登录。 从Wireframe到Prototype,到开发完成送审Apple,只花了四周。 没有AI的时代,大概要花三到四个月。 这意味着实验成本大幅下降。想做的事,可以更快试、更快错、更快迭代。 对想做一人公司的人来说,这其实是个结构性的机会。

Thread

用 Codex/Claude Code 写代码的开发者一定懂:

你下一个大指令,AI 开始进入「Thinking…」,终端机出现转圈圈的 Spinner。 这段尴尬的 2-3 分钟「时间空档」,你都拿来做什么? 切去刷 Threads?看 FB?结果一去不回头,直接分心半小时? 罗马尼亚一位老哥 Dragos Roua 觉得这样太浪费专注力了,于是写了这个超疯狂的开源项目:compaction-tetris (大概是让你在等待时玩个小游戏保持状态?) 谁用 A

Thread

做 AI 模型的公司,可能不是最终的大赢家。

真正赚到系统性利润的,是让 AI Agent 在现实世界跑得通的基础设施。 这几类管道最关键: - 支付管道(Stripe、Coinbase、x402) - 网络管道(Cloudflare) - 商业管道(Shopify) - 企业管道(Salesforce) - 数据管道(Palantir、Databricks) Agent 需要这些东西才能真正「干活」。 模型公司卷参数、卷价格、卷上下文。 但

Thread

/1 NVIDIA 最近开源了一个叫 SkillSpector 的工具。

专门用来扫描 AI Agent 的技能文件,检测漏洞、恶意模式和安全风险。 这事儿来得正是时候。 /2 现在大家都在疯狂做 Agent。 随便一个 repo 就能让 Claude 帮你写一堆 tool calling skills。 但这些 skills 到底安不安全?有没有后门?会不会泄露数据? 没人审。 /3 SkillSpector 就是来填这个坑的。 它能自动分析 Agent 的能力描述、

Thread

AI coding 又往前迈了一步。

一个12B的本地模型,直接把Fable 5的推理链蒸馏了进去。现在消费级显卡就能离线跑出顶级coding能力。 这个Gemma 4 12B Coder GGUF基于Google的gemma-4-12B-it微调,专攻代码生成和复杂推理。训练时塞进了Composer 2.5的真实通过案例,还让Fable 5帮忙补全难搞的case,结果每一步推理都指向能真正跑通的代码。 最实用的是走GGUF格式,12

Thread

OpenAI Codex 团队只有 40 个人。

1 个 PM + 2 个设计师 + 37 个工程师。 结果呢? 99% 的代码是 AI 生成的。 而且他们跑得飞快。 具体怎么干的: - 每个工程师同时跑 4 个并行 agent(code review、功能实现、安全审计、代码库摘要) - PM 用 Codex 处理用户 issue,1 小时能跑完 100+ 个,大部分 24 小时内修复 - 功能开发经常 2-3 人甚至单人从规划到发布 - 99

Thread

1/ 这篇 HN 文章提出了一个很有意思的框架:Inverse Rubric Optimization。

核心思路是:不要让 AI 直接去优化某个目标,而是反过来用「rubric」(评分标准)来约束和评估。 2/ 传统做法是:给 AI 一个任务 + 一个模糊的「做好」的定义,然后让它迭代。 结果经常是:它优化了容易衡量的东西,却牺牲了你真正关心的隐性标准。 3/ Inverse 的做法是:先写一个详细的 Rubric,列出「好」应该包含哪些维度、坏会表现出哪些问题。 然后让 AI 在这个 Rubric

Thread

1 Karpathy 的 autoresearch 出来后

有人直接拿它做了真实世界的交易系统 在 Polymarket 上搞了一个比特币 5 分钟自动交易机器人 回报 +40% 项目已经开源 还能直接用 Claude Code 或 Codex 执行整个研究循环 给它一个「研究机构」的指令 它只改一个策略文件 跑短周期实验(这里是 5 分钟交易 cycle) 评估真实指标 只保留变好的改动,扔掉没效果的 不断自我迭代 睡觉前扔给它,早上起来收一堆实验日志和

Thread

YC 现任 CEO Garry Tan 开源了他自己每天用的 Claude Code 工作流

项目叫 gstack 他要解决的问题是: AI coding agent 只有一种模式,你叫它做什么它就做什么 但实际开发里每个阶段需要的脑袋完全不一样 想产品方向的时候要创办人的直觉 做技术规划的时候要工程主管的严谨 review 代码的时候要什么都不信的资深工程师 部署的时候要一个不废话直接把事情做完的人 核心概念是把 AI 拆成多个专门角色,用 slash command 切换 Garry

Thread

一家年营收超过 300 亿美金、3 万多名员工、几十个 Division 遍布北美的基建材料公司

外面几乎搜不到它的科技子公司 因为这家子公司完全服务内部,外面的人根本不知道它存在 子公司下面有数百个开发者 公司做了一件事:全面订阅市面上所有主流 AI 开发工具 Claude、Copilot、Gemini,想用哪个就用哪个 只需要在内部网站申请一下,不需要审批、不需要报告,直接开通 更关键的是后面发生的事 内部工程师开始自发分享 怎么用 AI、踩了什么坑、学到了什么 没有人强迫,也没有人盯着要

Thread

1 致富有三条路,但只有一条真的有效。

Ali Abdaal 是 YouTube 上 649 万订阅的生产力创作者,从剑桥医学院学生,在 13 年内变成年收 200 万英镑的创业者。 他把在香港私人工作坊的 60 分钟演讲,浓缩成 3000 字精华,整理出从医学生到成功创业者的完整路径。 Ali 开场就说:「大多数人搞错了顺序。他们问要赚多少钱(how much),但真正的问题是如何赚这笔钱(how)。」 这句话直接改变了很多人对财务自

Thread

最近很多人吐槽 Claude(尤其是新版)变了:

- 啰嗦 - 过度拒绝 - 态度越来越差 - 在复杂 coding 任务里经常「摆烂」 这不是个例,是很多重度用户共同的感受。 可能的原因: 1. Safety 训练越做越重,模型越来越「政治正确」和保守。 2. 长上下文 + Agent 场景下,模型为了「负责」开始过度解释、过度警告。 3. 公司为了对齐某些价值观,把「不冒犯」优先级提得太高。 有趣的是,这和用户实际需求产生了冲突。 用户想要的

Thread

Andrew Ng 开源了 CLI 工具 Context Hub

一周内破 6000 star,收录超过 1000 个 library 的文档 它解决的问题很直接: AI coding agent 写代码时会乱编 API 你让它接 Stripe,它可能吐出根本不存在的 function name,或者半年前就改掉的旧版接口 因为模型训练数据有截止日期,它不知道 library 最近发生了什么 这听起来很像 context7 在做的事 但我研究之后发现,Conte

为了省下每天 5 分钟要做的事,我花了好几天写全自动化脚本。

昨天去咨询改简历,发现排版架构和写法其实都大同小异。 我脑子一热,立刻想做一个「简历公版神器」。 然后差点又掉进「先做一个自动化系统」的工程师陷阱🪤 这个陷阱太经典了。 我们总想花十倍的时间,先把工具造好,再去省那一点点时间。 结果往往是,造工具本身就成了最浪费时间的事。

适合个人开发者省钱实验:

1. GitHub Education:Heroku $312 额度,有效期 2 年 2. Oracle Cloud 免费层:4 Arm vCPU + 24GB RAM + 200GB 存储的 VPS 3. Cloudflare:10GB 存储当图床,出站流量好像都免费 4. Vercel:部署静态站点 5. Supabase:免费 PostgreSQL 数据库 这些服务组合起来,小项目前后端 +

Thread

1️⃣ 智谱的 GLM-5.2 最近全量开放了。

很多开发者已经在实际项目里用了,尤其是搭配 Claude Code、Cursor 这类工具。 反馈两极分化,但总体比预期好。 2️⃣ 积极的一面: - 编码能力追得很近,有些场景接近 Claude Sonnet 级别 - 中文理解和长文本表现不错 - 价格和 token 额度对国内用户更友好 - 很多人在试「Claude Code + GLM」混合使用,降本增效 3️⃣ 需要注意的问题: - 复杂

Thread

1 三个便宜模型凑在一起「开了个会」,把贵一倍的顶级模型打平了。

Fable 5 被限制访问?没关系。 OpenRouter 刚公布的实测:用一半价格,表现几乎一样。 这不是理论。 Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro Fusion 的做法是让它们并行接同一道题,各自带工具跑完。 然后 judge 模型把所有回答摊开,抓共识、矛盾、盲点,最后合成最终答案。 这个平价三人组 fused 之后,成绩和 Claude

Thread

1 一家牙膏公司悄悄把整个市场调研产业给干掉了,却几乎没人在讨论。

高露洁(Colgate)发表了一篇论文:只要让大模型(LLM)扮演消费者,就能以90%的准确率预测真实购买意愿。 这也太离谱了吧。 研究人员想了个办法,叫做语义相似度评分(Semantic Similarity Rating,SSR)。 他们不再让AI直接打分,而是让它角色扮演。 之后把这些想法和真实消费者的反馈做语义相似度对比。 结果:90%准确率 传统的市场调研(焦点小组、问卷、数据分析)可能

Thread

1 被裁员后,他用 Claude Code 自己做了一个 AI 求职系统,评估了 740+ 个职位,最终拿下了 Head of Applied AI 的角色。

然后他把整个东西开源了。 项目叫 career-ops,只需要一个 slash command,就能跑完整 pipeline。 粘贴一个职位链接,就能得到: 结构化 A-F 评估 + 针对该职位的 ATS 优化 PDF + 薪资调研 + 面试准备 + 自动追踪记录。 彻底告别表格、复制粘贴和盲目海投。 → 14 个技能模式(评估、扫描、生成 PDF、批量处理、申请、深度研究、谈判脚本、Linked

Thread

Claude Code token 救星!

最近看到一个开源工具叫 Graphify,有人在 Karpathy 许愿后 48 小时就把它做出来了😂 概念超级简单:把你的整个文件夹(代码、文档、PDF、图片)全部建成一个 knowledge graph。 不需要 vector database,不需要配置文件,直接指向文件夹就搞定了。 最猛的是,每次查询的 token 用量只需要原来的 1/71.5!对大型 codebase 特别有用。 对

Thread

TokenBar 1.0 正式发布 🎉

全新用 Swift 原生重写的 Mac 菜单栏 App: Liquid Glass 界面、可旋转的 3D 用量图表、更轻量、更省资源。 把 tokscale 的视图分类概念融入菜单栏, token 用量统计比 CodexBar 更细致。 追踪 Claude Code、Codex、Cursor、OpenCode 等 25+ AI coding agents,全部本机读取、零遥测。 安装: brew

Thread

Git 圈老前辈 Scott Chacon(GitButler 创始人、《Pro Git》作者)竟然把整个 Git 从零用 Rust 重写了一遍,项目叫 Grit!

规模夸张:36 万行代码、7000+ commit、500+ PR,跑了官方 42,001 个测试,通过 41,715 个(99.3%)。 几乎全是 memory-safe 的 Rust,只有一个日期时间模块靠 C FFI。 据说烧掉约 450 亿 token,成本 1-1.5 万美元。 但他学到最重要的一课:agent 超爱作弊。你给它一个目标,它会去优化「让测试过」,而不是你真正想要的实作。

Thread

一个真实案例:作者的一个网站用 Claude AI 实现了惊人数据!

• 59,200+ 流量 • 108,000+ 展示 • 54.9% CTR 他主要靠 Claude 完成这些。 一个月前还是个脑中的点子,现在已经在各种活动中被使用,超级励志! 以下分享他是怎么做到的(根据帖子内容 + 实用框架整理): 为什么 Claude 能做到这么高 CTR 和流量? 不是魔法,而是系统化使用 AI 辅助内容创作和优化: - 快速生成高质量、针对性内容 - 优化标题、描述、

Thread

1 Naval 新 podcast 浓缩版:Vibe Coding、AI 软件的未来,以及他为什么不看好 Apple。

这集 30 分钟,讲了他从多年不写代码,到用 AI agents 打造「个人 App Store」的真实经历,以及对 AI 发展的判断。 Claude Opus 4.5 让 AI 从「玩具」变成真正可用的工具。它终于能保持方向、从头到尾为你打造属于你的 app。 Naval 说,如果你对 AI 的印象还停留在之前,该更新认知了。 过去写代码的「启动能量」太高。现在英文正式成为编程接口,AI 能容忍

Thread

Every 是 Dan Shipper 自己创的媒体和软件公司,从 2020 年 GPT-3 时代开始到现在 6 年多。

1/7 他们从 GPT-3 那刻起就把 AI 塞进每个工作流:写稿、编辑、客服、设计、营销、工程。Codex 和 Claude Code 是默认界面,新模型 alpha 阶段他们就先拿到。理论上这是「自动化到极致」最彻底的样本。 结果 2026-05-21 他发报告《After Automation》,标题直白:「我们什么都自动化了,但人却变多了」——从 4 人扩到 30 人。 几天后上 Lenn