AI 不是一个东西,它是一个能力演进的过程。
60 秒理解 AI 的 4 个阶段: ① 大脑(LLM):思考 + 写作,但只知道训练数据里的东西 ② 大脑 + 书(RAG):思考 + 实时检索,知识不再过期 ③ 大脑 + 工具(Agent):思考 + 行动,能操作文件、浏览器、API ④ 大脑 + 团队(Multi-Agent):多个 Agent 协作,并行完成复杂任务
AI agent 的「应用商店」来了:SkillCenter
一条命令装好现成 skill,直插 Claude Code、Codex、自定义 agent。 它干的事: - 爬 GitHub + skill 库 - 提取 SKILL.md / SOUL.md - 打成一个可搜索的索引 Docker / React / RAG / Security 千种 skill,拿来即用。
Cloudflare 出了个新工具:Drop。
部署静态网站只剩一个动作——把文件夹拖进浏览器,几秒自动部署到全球边缘网络,连登录都不需要。 默认存活 60 分钟,够你分享 demo 或验证原型。想永久保留就点 Claim 绑定账号。 不用 Git,不用 CI,不用任何配置。拖进去就完了。
辭上了复利之后,生活就变了。
每天背50个单词,一年增加3000个词汇量。 每月读三本书,一年可以70本。 定期定额投资,慢慢累积复利。 持续创作,在技法和概念上不断进步。 每件事单独看都很平常,一直坚持下来后就得到结果了。 复利不需要你做什么大事,就是每天那些看起来琐碎的小事。
Marketing 这门学科的核心逻辑:
人的思维是可以被滲透、被塑造、被教育的。 所以这门学科堆称一门邪术。 掌控它的人不追鲁,不就范,只是知道“想要认知被塑造」是怎么运作的。
OpenAI 发布了 GPT-Live,用「全双工」架构把语音模型重做了一遍。
以前语音 AI 的三大痛点: ① 三个模型接力(转文字→想答案→再念出来),慢且生硬 ② 得等你完全说完才答 ③ 背景杂音一来就被当成“说完了”,直接抢话 GPT-Live 的全双工架构:端到端语音处理,不再中转文字,也不需要等你说完。 语音 AI 的体验问题终于开始被认真对待了。
Claude Code vs Codex 差在哪?
Claude Code: — 资深工程师助手 — 每天改很多文件、重构大型项目 — 习惯用 Terminal Codex: — 全方位 AI 开发工具 — 与 ChatGPT 生态整合 — 非工程师也能用 价格都是约 $20/月 一句话: 工程师深度开发 → Claude Code 想快速上手 → Codex
微软为什么几乎没有参与基础大模型竞赛?
谷歌有 Gemini,Meta 有 Llama,字节有豆包,阿里有通义千问。 微软与其他巨头不同,它早就没有主人了。Satya Nadella 只是个打工的。 Carl Icahn 说过,美国 CEO 的选拔机制往往是「反达尔文」的——老好人缘好、不做争议性决策、安全听话。Ballmer 敢打大赌,Nadella 选择了最稳妥的路:投资 OpenAI。 从 Windows Phone、收购诺基亚,
Meta 正式推出 Muse Spark 1.1,重点不是聊天,而是 agentic workflow、电脑操作、工具使用、写代码。
根据 Alexandr Wang 的说法,Spark 1.1 在多个 agentic 评测中已可与 GPT-5.5、Claude Opus 4.8 放在同一级别比较。 Spark 1.1 在 MCP Atlas、Finance Agent v2 等领先;但 SWE-Bench Pro、DeepSWE 等纯编码项目 Opus 4.8 或 GPT-5.5 仍领先。更准确的说法:Meta 终于有了一个可
有一个人在领英,进了一个 vibe-coded 的开源项目,发了连接请求。
然后打开浏览器的 Network 面板。 免费的 API Key 就这样拂到了。 这就是很多 vibe-coded 项目的现实:快速上线,但 API 密钥直接暴露在前端。 做开源项目,请先把密钥安全这个功课上好。
Gemma 4 现在是真正开源了,Apache 2.0 授权。
免费下载、可修改、可商用,甲还能离线跑在自己电脑和手机上。 支持 140 种语言,2B/4B 小模型连手机 GPU 都跑得动。 开发者:把 AI 嵌入自己的 App,不用付月费,数据完全自己管。 普通用户:下载到设备,离线处理图表、语音、视频,超私密。 和 Gemini 最大的区别:Gemma 4 是真开源,不是封闭的免费API。
6 家 NVIDIA 的竞争对手——不同公司、不同国家、不同架构——对 CUDA 的问题收敛到了同一个答案。
Tenstorrent、Cerebras、Trainium、TPU、SambaNova、Furiosa,六家不约而同,全部捨弃硬件快取,改用软件管理的 SRAM 架构。 原因很简单:AI 的访问模式规律到可以预测,投机式快取变成浪费,亲手安排好数据落点, cache miss 就不会发生。 这是 AI 芯片替代 NVIDIA 的路上,一条共同的技术斜坡。
GPT-5.6 Sol 现在跑在 Cerebras 的「一整片晶圆当一颗芯片」硬件上。
速度:每秒 750 token。 普通 GPU:每秒 40–12 0。 差距:10 倍。 4000 token 的输出,GPU 要等一分钟,Cerebras 大约 6 秒。 对做 AI agent 的人最有感:实时语音、实时 coding 的可行边界往前移了。 你用的 agent ,最卡的是不是它慢慢吐字那段?
别再无脑吹中国大模型了。
我承认,它们最大的优势是价格,甚至能威胁美国 AI 巨头。 但别动不动就吹成「全面超越」。 以 DeepSeek 为例,官方云端 API 到现在都没有提供图像输入。你可以说它有视觉模型,但一般开发者通过官方 API 根本用不了。 很多模型跑分很漂亮,真正放到 Coding、Agent、Tool Use、长流程工作流,差距还是在。 不卖你 1/6 的价格,还想要什么? 跑分没输过,实战没赢过。
TensorRT-LLM、FlashAttention 都已经 production level 了,学 CUDA 还有什么价值?
答案:价值依然很大,只是角色不同。 大部分 AI 工程师不需要重写 CUDA kernel,但要懂 GPU 原理—— 才能在这些场景做出正确决策: • 用什么规格的 GPU? • 部署 7B 还是 70B? • Chatbot 还是 RAG 架构? • 单用户还是多人并发? 这些直接影响 Batch Size、KV Cache、Precision、Continuous Batching 怎么配。
ChatGPT Work是什么?新手完整教学:做什么、怎么用、风险在哪
ChatGPT Work 是 OpenAI 推出的工作型 AI Agent,和普通 ChatGPT 最大的区别是:它不只回答你的问题,而是能帮你完成一份完整的工作成果。 会议记录整理成待办清单、多份文件整理成简报大纲、表格分析后出具报告——这些都是它能做的事。 但它也有明确限制,不是什么都能交给它处理。本文用新手能看懂的方式说清楚:ChatGPT Work 能做什么、新手怎么开始用,以及最容易忽略
黄仁勋在 Stanford 被学生问:在零亿美元市场里待了十几年,信念从哪里来?
他的答案是一个英伟达内部缩写:EOIFS Early Indicators of Future Success——未来成功的早期指标。 他说:「很多人说 KPI 是毛利率。毛利率是结果。你要找的是结果出现之前的正向信号,越早越好。」 他的纪律是把两件事分开:赚不赚钱是结果,做的事对不对是证据。 他找的早期信号长这样: • 解决了过去解不了的问题——市场还没出现,但重要的问题在被一个个解掉 • 工作
Indie hacker 必收藏:free for dev
收集了几百个开发工具的免费额度(Free Tier),分类清晰: • 云服务:AWS、GCP、Cloudflare • 数据库:Supabase、Neon、MongoDB Atlas • 部署:Vercel、Netlify、Railway • 监控:Sentry、Better Stack • AI 工具、向量数据库、LLM 监控 低成本验证想法,从这里开始。
有人在 GitHub 做了一套免费 AI 课程。
不是理论,是完整实战系统: Week 1 → Docker + FastAPI + 数据库 Week 2 → 自动化数据管线 Week 3 → 自己搭搜索引擎(BM25) Week 4 → 混合搜索(语义+关键词) Week 5 → 完整 RAG 系统 Week 6 → 生产级(缓存+监控) Week 7 → 用 LangGraph 做 Agentic AI 不是「学 AI」,是动手做出来。
AI Agent 中文学习路径——两条路线,找到你的路:
路线 A(8-10 周):CLI 进阶使用者,用好现有 Agent 工具 路线 B(16-22 周):Agent 开发者,打造属于你自己的 Agent 共同经过 Claude Code 生态(MCP / Skills / Subagents)和 Agent Interfaces(Computer Use / Browser Use) 每周投入 5-8 小时,系统走完。
腾讯开源 Hy3 preview。
295B 总参数,但每次只激活 21B;上下文拉到 256K。 重点不是参数表,而是它把代码、推理、Agent 能力放在同一条线上。 国产开源模型正在从“能聊天”往“能干活”卷。 接下来比的不是谁会背答案,而是谁能长期执行任务。
一个待过 Scale、OpenAI、Google 的工程师写了篇职涯建议
里面一句话让我停了很久: 「AI 只会变强在你写得出评分标准的事情上」 什么意思? 只要一件事有标准答案、能打分——AI 就会越练越强,最终超过你。 帮你改邮件语气、翻译、修代码、排版——它超会。因为对错很明确。 但这几种它只能站旁边看你决定: 这笔钱投产品还是投营销 这个合作该不该答应 今天最该花力气的是哪一题 它可以列优缺点,但它没真的活过、没亏过钱、没被坑过。 最后那一下要不要赌,还是你自己
2026年AI从业者的知识鄙视链要变了。
光会调 API 不够了。这8个方向值得重点投入: Agentic Loops、MCP、MultiAgent System、AI Gateway Inference Economy、Evals、Guardrails、Observability 有个规律:前4个是"搭什么",后4个是"怎么不翻车"。 只盯架构,不懂 Evals 和 Observability,系统上线就是盲飞。
2026年下半年,这8个AI概念值得重点关注:
- Agentic Loops(智能体循环) - MCP(模型上下文协议) - Subagents & MultiAgent System(多智能体系统) - AI Gateway(AI 网关) - Inference Economy(推理经济) - Evals(评估体系) - Guardrails(护栏机制) - Observability(可观测性)
这看起来比 FreeLLMAPI 还厉害,准备部署试试。
OmniRoute — 免费 AI 网关,TypeScript 编写,单一本地端点(/v1)聚合 237 个 AI 提供商,其中 90+ 有免费额度。 核心是 4 层自动回退(订阅 → API Key → 便宜 → 免费),毫秒切换,17 种路由策略,再用 RTK + Caveman 堆栈压缩省掉 15–95% 的 token。 能自动在免费额度的提供商之间切换,不用自己一个个试了。
video-use 是 Browser Use 团队推出的开源工具,让 Claude Code、Codex、Cursor 等 AI Coding Agent 具备视频剪辑能力。
它不是要取代 Premiere 或 CapCut,而是通过 prompt + 工具脚本的工作流,让 LLM 先读取视频转写文本,在需要时调用可视化工具辅助判断,最后通过 ffmpeg 完成剪辑。 核心价值:让 AI 不必真的「看懂」整支视频,而是通过文字、时间轴与工具协作,完成更精准可控的剪辑。
一篇文章标题很反直觉:「Doing nothing at work」(在工作时什么都不做)
核心观点:工程师一整年的绩效,往往由少数几个关键时刻决定。可能是一次救了产品的调试、一个让团队少走半年弯路的架构决策。这些关键时刻没法排进日历,来的时候你要有余裕才接得住。 如果平常就把自己逼到100%满载,等真正的关键时刻来临,反而没力气把它做好。 作者建议刻意练习「什么都不做」,让自己维持在80%使用率。
真正有远见的人,都开始培养这 8 种能力
1. 不要只学会工作,更要学会思考。工作可以带来收入,思考才能创造机会,认知越高,选择越多。 2. 不要只追求速度,更要追求方向。方向正确,一小步也是进步;方向错了,再努力也只是消耗自己。 3. 学会管理时间,而不是被时间管理。把时间留给学习、健康、重要的人,以及能创造未来的事情。 4. 培养解决问题的能力。每解决一个问题,你的能力就提升一分;每创造一份价值,你的机会也会增加一分。 5. 建立值得
2 分钟搭出一个能打电话的 AI,xAI 刚发了 Voice Agent Builder
以前做语音客服要拼三块:语音转文字 + 大模型 + 文字转语音,三个厂商,三倍延迟,三倍出故障的机会。 这个工具是端到端「语音对语音」,和 Grok Voice 紧耦合,不是拼装货。 跑分上 Grok Voice 在 τ-voice Bench 拿 67.3%,Gemini Flash Live 43.8%,GPT Realtime 35.3%。 怎么用:写段大白话描述通话流程 → 挂知识库 →
GitHub 上有一堆免费到离谱的项目,很多能力已经能干掉你正在月付的软件:
TradingAgents — AI 多 Agent 量化交易框架 LibreChat — 一个界面接入 GPT/Claude/Gemini HyperFrames — HeyGen 开源的视频生成引擎 Fincept Terminal — 开源版彭博终端 MoneyPrinterTurbo — AI 一键生成短视频 Agentic Inbox — Cloudflare 开源 AI 邮件助手