MiniMax H3 8G 最低配:我们从装到出片跑完的全流程
--- 网上已经有 MiniMax 的「保姆级」了。这篇不重复那条路。 **这篇只干一件事:8G 显存最低配,我们从头到尾跑完的全流程。** 机器是 RTX 3060 Ti 8GB + 56GB 内存。能出什么规格、要等多久、开到哪一档会撞墙——全是这台机器上的实测,不是官方推荐表抄下来的。 MiniMax H3 是画面和声音**一次生成**的视频模型:环境音、音效、配乐和画面在同一次前向传播里一
很多人担心 AI 写代码“能跑但不专业”——变量命名乱、没测试、架构随手拍。
Addy Osmani(Google Chrome 团队)把这个问题系统化解决了:agent-skills 是一套面向 Claude Code、Codex、Cursor 的工程规范库,覆盖代码质量、测试策略、架构规范,相当于给 AI 装了一个资深工程师的习惯。 GitHub Trending 第二,83k+星,今天涨593,值得收藏备用。
一张图看懂开源模型的护城河:OpenCode 平台上,DeepSeek V4 Flash 的调用量是63,300次,Grok 4.5只有120次,差了500多倍。
原因很简单:DeepSeek 涨价后,OpenCode 没跟着涨,自己把 DeepSeek V4 Flash 部署了一遍,成本更低,额度还翻倍。 闭源模型涨价的时候,开源模型的用户可以直接绕过供应商——这才是开源真正的杠杆。
为什么 AI 时代还需要继续用 Anki
跟 ChatGPT 聊完,我会有种「这下懂了」的爽感 两周后再被问到同一个细节 脑子里经常只剩浆糊 模型讲得挺清楚 是我会忘 我现在的用法就一句 **AI 负责学得快** **Anki 负责忘得慢** 下载:[Anki](https://apps.ankiweb.net/) --- 我现在学东西,大量靠大模型 追问、举反例、当场考我 启动成本几乎为零 当场理解变强了 过一阵还是会忘 当场 quiz
看到一组反直觉的性能数据:Cloudflare 新出的浏览器 Kitesurf,跑起来比 Chromium 慢,但便宜得多。
墙钟时间上,截图慢 1.8 倍,HTML extraction 慢 1.7 倍。但看 CPU 和内存——CPU 少用 3.1 到 3.8 倍,内存少用 4.7 到 7 倍。 这个反差不是 bug,是设计选择。Kitesurf 完全跑在 Cloudflare Workers 上,V8 isolates,没有 Chrome process,没有 container,用 Rust 写完透过 wasm-b
微软负责往 Windows 里塞东西,开源社区负责帮你把它们删干净——大概是当下最精准的一句总结。
有个 PowerShell 脚本在 GitHub 上冲到 51K+ 星,专门清理 Windows 11 里那些删不掉的预装软件、Bing 搜索、Copilot、OneDrive 弹窗、定向广告。一条指令,遥测数据、诊断追踪、Recall、Edge 内置 AI,能关的全关掉,连 Windows 10 的经典右键菜单都能恢复回来。 支持参数化部署,配置还能导出到别的电脑直接用。MIT 开源,不收钱,不
你以为 Obsidian 内置了 AI 大脑?打开一看,一行 AI 代码都没有。有朋友冲着“打造 AI 第二大脑”的文章去装了 Obsidian,跟着教程做了半天,回头问我:它的 AI 在哪?答案是:没有。它就是个文字编辑器,不整理笔记,不
你以为 Obsidian 内置了 AI 大脑?打开一看,一行 AI 代码都没有。有朋友冲着“打造 AI 第二大脑”的文章去装了 Obsidian,跟着教程做了半天,回头问我:它的 AI 在哪?答案是:没有。它就是个文字编辑器,不整理笔记,不答问题,不归纳重点。 但 Obsidian 加 AI 确实能变成第二大脑,这事是真的——关键不在软件本身,在你怎么操作同一个文件夹。讲讲我实际的用法。 先搞清楚
腾讯云开源了个东西,叫 TencentDB Agent Memory,专治 AI Agent 每次对话都忘个一干二净的老毛病。
它把对话、文档、代码打包成四类可复用记忆资产(Chat Memory / Skill / LLM-Wiki / Code-Graph),团队里所有 Agent 共用同一套记忆,不用各自重新学一遍。 今天涨了 1111 星,总数 14212,直接冲上 GitHub Trending 第一。
跨平台还要原生,这两个要求放在数据库工具上通常很难同时满足。
gridex做到了:macOS、Windows、Linux都是原生应用(用Swift+AppKit构建),一个客户端里能连PostgreSQL、MySQL、SQLite、Redis四种数据库。 主打键盘驱动的快速操作,不是那种鼠标点来点去的臃肿IDE。 开源,814星标。
一张 AI 生成的设计图,最后做成了能直接操作的 3D 人体解剖 App。
Anatomy Atelier:网页上旋转缩放器官、看位置、点热点,还带课程笔记测验。 流程像现在 AI 产品开发缩影: ① GPT Image 出界面和器官图 ② Tripo 转 3D ③ 设计图+模型+需求丢给 Codex ④ 生成 Three.js 网页和交互 真正卡点在性能: 单模型 120–150MB,全套近 900MB,浏览器只剩 16FPS。 多轮优化后: 900MB → 28.6M
别再让 Agent 死等 OCR。
Firecrawl 开源 pdf-inspector: - 20ms 级分类 - 直接抽 Markdown - 200 份约 2.8 秒 - Rust,表格图表友好 Agent 读文档,终于不那么卡。
高通花约 39 亿美元(全股票)买 Modular。
Swift 之父 Chris Lattner 也进高通。 别先理解成硬刚 NVIDIA。 更像是要抓住手机和边缘侧那层软件入口。 高通的痛不在峰值性能。 在边缘软件栈太碎:手机、车、PC 各一套。 Mojo / MAX 进来,等于握住边缘 AI 开发者的默认出路。 全股票:短期看研发,长期看 SDK 话语权。 对台湾 NPU / Edge ASIC 更直接: 硬件接不上这套软件引擎, 可能从架构设
10000 粉之后:用完整路径代替更用力
写这篇文章的时候,粉丝数是 10344。刚过万 fo(一万粉丝)。 万 fo 之后干什么,我在 8900 左右就在想,更早以前也在想。跨过这条线前后,心态其实差不多——真正困扰我的,从来不是数字本身。 这篇不是庆祝文,也不教你怎么涨粉。 我想把一件事说清楚:**要稳定持续地做自媒体,就得有完整工具;卡在哪一段,就先补哪一段。** --- 以前做内容,很难不盯人数。大家都有一个憧憬,叫「万 fo」。
YouTube Premium 真正值钱的,很多人只是「去广告 + 后台播放」。
开源前端 Invidious 把这两点(以及免登录、少追踪)做了,还去掉自动播放和算法投喂。浏览器直接开,公共实例能用,也支持自己架。 不是完美替代全家桶,但对「只想安静看完一支片」够用了。链接在下一条。
很多国外赚钱项目,在中国至少晚半年到两年。
这段空窗,就是信息差最大的时候。 Notion 模板、AI 提示词库、健身计划、减脂打卡、个人财务表——国外卖 $9–$99,有人买回来本土化,挂闲鱼、小红书、知识星球、淘宝,卖 9.9 / 19.9 / 49。 重点不是照搬,是加中文案例、适配国内软件、补教学。 大部分人不想啃英文原文,愿意为省时间付钱。 信息差的本质,经常是跨语言套利。
认知越高,话往往越少。不是变冷漠,是知道每句话都有代价。
普通人追直线答案:对错、好坏、能不能赚钱。高认知者脑子里是前提、变量、概率和灰色地带。硬解释必丢信息;不解释又像端着。 更关键的转向:从证明自己,到安顿自己。把争辩和求认同的能量收回,用在内在秩序上。 若你越来越不想辩——也许不是退步,是终于懂得分拣听众。
我不想再“剪下一条视频”了,所以做了 TudouFlow
> 从选题、脚本、画面、配音、字幕,到横竖版成片、封面和平台文案:这是我把个人 AI 视频工作流改造成一套生产系统的过程。 我做 AI 视频之后,遇到的最大问题一直不是“不会做”。 真正的问题是:**每做一期,都像第一次做。** 选题时重新查资料,写稿时重新搭结构,文案定了才开始想画面。横版做完,还要重新处理竖版;配音分段生成后,可能每一段语速都不一样;临到发布,又发现字幕、封面、简介和标签还没有
范冰把一本二十多万字的新书免费开源了:
《前置部署工程师:人工智能时代的客户价值交付秘籍》 FDE:驻扎客户现场,把「产品能做的」和「客户需要的」接起来。 Palantir 当年在保密室里做出来的工种,如今 OpenAI 为它单独立了部署公司。 他的说法:这是 AI 时代前置位的「增长黑客」。 全书在线读,不收一分钱。
Google Flow新手怎么用:20分钟做出第一条AI短片
想试 Google 的 AI 视频,通常卡在三件事:贵不贵、会不会写 prompt、角色会不会换脸。 第一条往往不好看;单条通常只有几秒;输出带水印;部分地区进不去。旧博客里「必须 Pro、每月 100 次」那套也别信了,规则早换成积分制。 按本文这一条默认路径,大约 20 分钟,你能走完:打开 → 看积分 → 让 Agent 出分镜 → 用省点模型至少生成 **1 条**能看的短镜 → 有余力再
别急着辩论谁更努力。
先看决策入口: 穷人默认先避险,富人默认先看杠杆与时间。 不是谁道德更高,是系统不一样。 思维定认知,认知定行为。 你每天问自己的第一个问题,比你今天赚多少更重要。 图放全了。对照着看,比空喊改变心态有用。
Claude 现在也能「看影片」了?不是官方新功能,是社区开源工具 Claude Video。
一个指令分析 YouTube、TikTok、本机视频: 1. 优先 yt-dlp 拉字幕 2. 没字幕再 Whisper 3. ffmpeg 抽关键帧(不是固定频率乱截) 4. 画面 + 字幕 + 时间戳一起丢给 Claude 长片建议加 --start / --end,不然 Token 先被重复画面吃光。 适合:竞品发布拆解、长教程摘要、录屏找 bug。记住——这是开源胶水层,深度仍取决于字幕质
想对比开源模型和 ChatGPT/Gemini,别只会刷评测表。
Hugging Face 自己做了免费聊天界面: - 跑的是各类开源模型,不是商用那套 - 完全免费 - 连前端代码都能拉下来自己架 想知道「开源模型日常对话到底差在哪」,这是最直接的入口。
想试本地大模型,别一上来乱下 70B。
我的起步顺序: 1. 先上 Qwen3.6 27B——手感/速度平衡 2. 觉得慢,再试 Qwen3.6 35B-A3B(MoE 路线更省) 3. 显存紧:Qwen3.5 9B 先把「能稳定跑、愿意天天用」做出来,再卷更大模型。本地玩的是工程,不是榜单。
有些工程原理,说一百句不如看十秒。
这段视频拍的是一个缩比例的海岸工程模型,原作者的配文只有一句韩语感叹:"微缩模型形态的海岸工程,太神奇了。" 这种震撼感我完全能理解。海浪怎么被结构消解、堤坝怎么在冲击下生效,这些抽象概念光靠文字很难讲清楚,缩小到模型尺度、用眼睛直接看一遍,比任何说明书都直观。 好的工程演示,从来不需要多余的解说词。
如果电脑上的操作都能交给AI代劳,你会先让它干哪件事。
微软最近给了个却意外的答案:Fara,一个专门干“操作电脑”这事的开源模型,刚更新到 1.5。 它不靠聊天工作,而是直接看屏幕截图,跟人一样去点鼠标、敲键盘,自己去填表、比价、订票、搜资料。 更打动我的一点是它能完全本地跑:LMStudio、Ollama、vLLM 直接载入 Fara-7B,MacBook M4 Pro 上跑量化版都没问题,数据不用传上云。 免费,开源,架构也换成了 Qwen3.5
自己注册的域名,邮箱地址却还在用 Gmail 后缀,看起来总差一点专业感,但企业邮箱又要花钱。
Cloudflare Email Routing 解决了这个问题:免费把邮件转发规则配置好,搭配 Gmail 设置发信身份,就能直接用自己的域名收发邮件,操作还是在 Gmail 界面里完成。 免费、零维护成本,适合独立开发者和小站长。
大多数人赚钱的方法论都能归进这四类,而且几十年没变过:执行差(懂的都懂,就看谁真去做)、认知差(我看懂的局你没看懂)。
竞争差(同样在做,但我做得更精)、信息差(我先知道,你还不知道)。 稻盛和夫把这四条列出来,其实是在提醒一件事:光懂道理没用,赚钱靠的是把某一种差真正拉开,而不是懂了就以为自己已经赢了。
一直以为本地模型顶多能聊天、写点简单代码,实测发现能干的比这多。
用 Hermes agent 配 mlx 跑的 Qwen3.6 35b A3b,全程本地,没连任何云端 API。 给它的任务是装一个叫 cork 的软件(homebrew 的图形界面)。它自己上网搜到对应的 GitHub repo,clone、编译、装进 /Applications,一条龙做完。 这种自己找资料、自己动手装软件的多步骤 agent 任务,以前觉得只有云端大模型才靠得住,现在本地也能
百度网盘 - 闲鱼 MCP 一键发布,让你有价值的资料变成持续赚钱的机器
你网盘里是不是也躺着几十个 G 的资料?真正卡住你上架闲鱼的,往往不是「有没有货」,而是那套重复劳动:翻文件夹找素材、下载到本地、开闲鱼网页填标题图价格、点发布——每一件新货都要重来一遍。 这套重复劳动,够格交给 Agent 做,你只需要最后点头确认。 今天讲的就是这条链路:**百度网盘 + 闲鱼 + Agent(MCP)**。 把网盘接成工具,把闲鱼接成工具,再串成「找资料 → 写介绍 → 打草
前端圈总有人说 html-in-canvas 是个听起来厉害但实用性不强的技术,这个演示直接推翻这个说法。
把普通 HTML 元素放进 canvas 渲染,交互流畅度看不出明显割裂感,跟原生 DOM 渲染的体验差距比想象中小很多。 技术选型这东西,光看理论争论没用,动手试一次比看十篇分析文章都管用,链接在下面自己感受一下。