OctoNews

笔记 · 技术和认知提升

开源

技术和认知提升中与开源相关的内容。 共 35 条。

Thread

30B 的 agent 模型,宣称 24GB VRAM 就能跑?

Muse Glimmer 开源了(Apache 2.0,权重在 Hugging Face):规划、工具调用、自检、失败恢复内建。 4-bit 量化把内存压到 20GB 以下,还留空间给 KV cache 与 drafter。 本周起可走 ollama / LM Studio / vLLM / sglang 等路径,也兼容 llama.cpp、MLX。 自架 agent 的门槛又下一截——真假强弱仍

Article

为什么 AI 时代还需要继续用 Anki

跟 ChatGPT 聊完,我会有种「这下懂了」的爽感 两周后再被问到同一个细节 脑子里经常只剩浆糊 模型讲得挺清楚 是我会忘 我现在的用法就一句 **AI 负责学得快** **Anki 负责忘得慢** 下载:[Anki](https://apps.ankiweb.net/) --- 我现在学东西,大量靠大模型 追问、举反例、当场考我 启动成本几乎为零 当场理解变强了 过一阵还是会忘 当场 quiz

Thread

微软负责往 Windows 里塞东西,开源社区负责帮你把它们删干净——大概是当下最精准的一句总结。

有个 PowerShell 脚本在 GitHub 上冲到 51K+ 星,专门清理 Windows 11 里那些删不掉的预装软件、Bing 搜索、Copilot、OneDrive 弹窗、定向广告。一条指令,遥测数据、诊断追踪、Recall、Edge 内置 AI,能关的全关掉,连 Windows 10 的经典右键菜单都能恢复回来。 支持参数化部署,配置还能导出到别的电脑直接用。MIT 开源,不收钱,不

Claude 现在也能「看影片」了?不是官方新功能,是社区开源工具 Claude Video。

一个指令分析 YouTube、TikTok、本机视频: 1. 优先 yt-dlp 拉字幕 2. 没字幕再 Whisper 3. ffmpeg 抽关键帧(不是固定频率乱截) 4. 画面 + 字幕 + 时间戳一起丢给 Claude 长片建议加 --start / --end,不然 Token 先被重复画面吃光。 适合:竞品发布拆解、长教程摘要、录屏找 bug。记住——这是开源胶水层,深度仍取决于字幕质

Thread

如果电脑上的操作都能交给AI代劳,你会先让它干哪件事。

微软最近给了个却意外的答案:Fara,一个专门干“操作电脑”这事的开源模型,刚更新到 1.5。 它不靠聊天工作,而是直接看屏幕截图,跟人一样去点鼠标、敲键盘,自己去填表、比价、订票、搜资料。 更打动我的一点是它能完全本地跑:LMStudio、Ollama、vLLM 直接载入 Fara-7B,MacBook M4 Pro 上跑量化版都没问题,数据不用传上云。 免费,开源,架构也换成了 Qwen3.5

Article

百度网盘 - 闲鱼 MCP 一键发布,让你有价值的资料变成持续赚钱的机器

你网盘里是不是也躺着几十个 G 的资料?真正卡住你上架闲鱼的,往往不是「有没有货」,而是那套重复劳动:翻文件夹找素材、下载到本地、开闲鱼网页填标题图价格、点发布——每一件新货都要重来一遍。 这套重复劳动,够格交给 Agent 做,你只需要最后点头确认。 今天讲的就是这条链路:**百度网盘 + 闲鱼 + Agent(MCP)**。 把网盘接成工具,把闲鱼接成工具,再串成「找资料 → 写介绍 → 打草

Thread

一个 $16 账单,逼出了 6 万星开源爬虫。

Unclecode 被「付费开源」工具激怒,几天写出 Crawl4AI:免费、无限次、本机跑,比 Firecrawl 快约 6 倍。 适合谁: · RAG:爬文档喂模型 · 竞品监控:自动抓价格 · 学术:爬论文转结构化数据 月费 0 元 vs Firecrawl $19–500。你付钱,还是花几天自己 build?

Thread

一个 $16 账单,逼出了 6 万星开源爬虫。

Unclecode 被「付费开源」工具激怒,几天写出 Crawl4AI:免费、无限次、本机跑,比 Firecrawl 快约 6 倍。 适合谁: · RAG:爬文档喂模型 · 竞品监控:自动抓价格 · 学术:爬论文转结构化数据 月费 0 元 vs Firecrawl $19–500。你付钱,还是花几天自己 build?

Article

AI出图总像广告?抄这组极简Zine海报提示词

用 AI 出海报,最常见的翻车是两种: 一是**太满**——主体铺满画面,像电商主图。 二是**太炫**——电影光、霓虹、3D,像宣传片截帧。 最近刷到一个开源 Codex 专用技能包(skill):[gc-minimal-zine-poster](https://github.com/LiamGvchi/gc-minimal-zine-poster)。它做的事很窄:把一句话、一个物件、一种情绪,

Article

你的 Kindle 能跑微信读书了

先说三件事,帮你搞清楚这篇文章在解决什么问题。 **第一,Kindle 的硬件是真的好。** 屏幕素质、手感、续航,在墨水屏阅读器里是第一梯队。如果你把它和国产阅读器对比,硬件体验基本上是一个量级的。Kindle 的问题不是硬件,是软件——它是闭源系统,不能随便装应用。 **第二,微信读书是腾讯旗下最不被骂的产品。** 书库大、更新快、有会员、有划线同步、有阅读统计——用过的人很少不续费的。它还有

Article

ChatGPT 桌面多了个小宠物?它不只可爱,还能告诉你 AI 在干什么

你打开 ChatGPT 桌面应用,发现右下角多了个小动物在那里挥手。 它不是广告,也不是彩蛋,而是 OpenAI 在 2026 年 5 月推出的功能:**Codex Pets**。 可爱是真的,但它实际上是个工作状态指示器——告诉你 AI 在后台跑什么任务、有没有卡住、要不要你过来处理一下。 \--- Codex Pets 是 ChatGPT 桌面应用里 Codex(AI 编程助手)的一个悬浮小角

Gemma 4 现在是真正开源了,Apache 2.0 授权。

免费下载、可修改、可商用,甲还能离线跑在自己电脑和手机上。 支持 140 种语言,2B/4B 小模型连手机 GPU 都跑得动。 开发者:把 AI 嵌入自己的 App,不用付月费,数据完全自己管。 普通用户:下载到设备,离线处理图表、语音、视频,超私密。 和 Gemini 最大的区别:Gemma 4 是真开源,不是封闭的免费API。

腾讯开源 Hy3 preview。

295B 总参数,但每次只激活 21B;上下文拉到 256K。 重点不是参数表,而是它把代码、推理、Agent 能力放在同一条线上。 国产开源模型正在从“能聊天”往“能干活”卷。 接下来比的不是谁会背答案,而是谁能长期执行任务。

Thread

HTML 版剪映来了,开源免费。

html-video 内置 20+ 套视频模板,适合产品宣传、知识解说、数据可视化。 基于 HyperFrames 框架,Apache 2.0 开源。 github.com/HyperFrames/html-video

Thread

做 RAG 踩过最多坑的地方不是模型,是文件前处理。

表单、流程图、多栏 PDF 扔进去,出来的文本全是乱的,召回自然差。 有人开源了一个专门解决这个的小工具:Semark。 把 PDF / Office / HTML / 图片转成适合知识库的 semantic Markdown——不只是 OCR,而是尽量保留表格结构、字段关系和语义层级。 基于 MinerU,可接 Ollama 或 OpenAI-compatible VLM/LLM,支持自动分档。

Thread

GLM-5.2 出来了。

在开源 Agent 模型里,被评为一次真正的跃升。 多步推理和工具调用,逼近闭源模型水平。 可本地部署,数据不出境。 对有数据合规要求的企业,这是重要选项。

Thread

最近 Design Arena 评测:GLM-5.2 在单轮 HTML 网页设计上干掉了 Fable 5,拿下第一!

Claude 产品线(Fable 5、Opus 系列)之前一直霸榜,这次被开源模型第一次拉下来。 GLM-5.2 是 MIT 开源、744B 参数。 对手参数据说能大它 6.7 倍,还没有视觉能力。 但 GLM-5.2 还是赢了。 这说明开源模型在网页设计任务上,已经能和最强闭源模型正面刚了。 价格方面也更具优势。 对开发者来说,这是个好消息——开源路线在特定场景越来越能打了。 你会考虑用 GLM

Thread

想搭知识库?GitHub 上这几个开源工具分工很清晰:

FastGPT:基于 LLM 的知识库平台,工作流、问答、数据集管理完整,适合企业快速搭建。 LLM Wiki:桌面端文件整理成互联知识库,适合个人笔记和本地查阅。 llm-wiki-agent:扔资料让 AI 自动读、整理、维护,像会自己更新的 wiki。 OpenKB:轻量开源知识库,适合先跑最小可用版本。 不同需求选不同工具。 项目链接: FastGPT: https://github.co

Thread

刚刚发现一个很有意思的开源项目 —— Paca 🦙

一个完全免费、可自架的 Scrum 项目管理工具,可以取代 Jira、Trello、ClickUp、Monday。 最特别的地方是:AI agent 不是外挂 chatbot,而是直接作为「队友」加入 Scrum 团队 —— 一起在同一个看板上认领任务、参与冲刺规划、协作撰写需求文件。 支持 Claude Code /paca 指令,也有 MCP Server 可接入各种 AI 工具。完全开源(A

Thread

小米开源 Code 工具来了!

Mimo Code 免费开源,基于 OpenCode 做了不少优化: - 无限上下文自动压缩 - 多决策并发生成最优解 - 支持 goal、dynamic workflow、自进化等 很多需要手动调的东西直接集成,设计理念很不错。 值得研究借鉴,小米 AI 团队的设计品味也在线👍

Thread

把 Elon Musk 变成了你的开源 AI 创业导师!

基于《The Book of Elon》,做了 10 个 skill,覆盖从第一性原理思考、The Algorithm 规划、删除优先编码、SpaceX 测试、疯狂紧迫感发货,到自进化团队等全生命周期。 直接在 Cursor、Claude Code、Codex 等工具里用。 开源免费,推荐给大家。

Thread

Warp 创始人 Zach Lloyd(前 Google Docs 首席工程师)写了一篇很实用的文章,讲如何给 AI 的 Skill 建立「自我改进循环」。

1/3 核心思路:让 agent 不仅执行任务,还能根据真实人类反馈,自己改进自己的 Skill 文件。 因为 Skill 就是普通 Markdown 文件,agent 改它就等于打 diff,自我进化变得可落地。 2/3 他把流程拆成两个循环(以 issue triage 为例): Inner loop(执行):新 issue 进来 → GitHub Action 触发云 agent → 加载

Thread

AI coding 又往前迈了一步。

一个12B的本地模型,直接把Fable 5的推理链蒸馏了进去。现在消费级显卡就能离线跑出顶级coding能力。 这个Gemma 4 12B Coder GGUF基于Google的gemma-4-12B-it微调,专攻代码生成和复杂推理。训练时塞进了Composer 2.5的真实通过案例,还让Fable 5帮忙补全难搞的case,结果每一步推理都指向能真正跑通的代码。 最实用的是走GGUF格式,12

Thread

1 Karpathy 的 autoresearch 出来后

有人直接拿它做了真实世界的交易系统 在 Polymarket 上搞了一个比特币 5 分钟自动交易机器人 回报 +40% 项目已经开源 还能直接用 Claude Code 或 Codex 执行整个研究循环 给它一个「研究机构」的指令 它只改一个策略文件 跑短周期实验(这里是 5 分钟交易 cycle) 评估真实指标 只保留变好的改动,扔掉没效果的 不断自我迭代 睡觉前扔给它,早上起来收一堆实验日志和