OctoNews

笔记 · AI 工具

模型部署

AI 工具中与模型部署相关的内容。 共 12 条。

Thread

8GB 显存到底能跑多大模型

别再靠感觉了 llmfit 扫一眼你的内存、CPU、显卡 按「能不能塞进去」「会不会卡死」「质量够不够」打分 我刚测过 27B 塞进 8GB 这种工具本该先跑一遍 再下载那十几个 G

Article

8GB 显存,能不能跑 27B?我用 RTX 3060 Ti 实测 Qwen3.8-27B

先说答案:能跑,但不算流畅。 我在一台 Windows 台式机上,用 RTX 3060 Ti 8GB 跑通了 Qwen3.8-27B。命令行生成速度约 1.7 tokens/s,本地 API 测到约 1.9 tokens/s。 这个结果适合技术验证、轻量问答和偶尔写作,不适合拿来做高频编码助手,更别说多人服务。 如果你也是 8GB 显存,最重要的不是照抄我的每个参数,而是先选对路线:**GGUF

Thread

吴恩达出了个开源工具:OpenWorker,本地端 AI 桌面助理。

和一般聊天式 AI 不同,它直接交付工作成果——写好文档、排好会议、发完 Slack、整理完收件箱。 四个特点值得关注: - 原生 25+ 办公工具连接器(Gmail、Notion、Jira、GitHub),兼容 MCP 生态 - Local-first 架构 + MIT 协议,数据留在本机 - 发信等关键动作强制人工审核,安全可控 - 不绑定单一模型,OpenAI/Claude/DeepSeek

Thread

如果电脑上的操作都能交给AI代劳,你会先让它干哪件事。

微软最近给了个却意外的答案:Fara,一个专门干“操作电脑”这事的开源模型,刚更新到 1.5。 它不靠聊天工作,而是直接看屏幕截图,跟人一样去点鼠标、敲键盘,自己去填表、比价、订票、搜资料。 更打动我的一点是它能完全本地跑:LMStudio、Ollama、vLLM 直接载入 Fara-7B,MacBook M4 Pro 上跑量化版都没问题,数据不用传上云。 免费,开源,架构也换成了 Qwen3.5

Thread

多数股票分析工具只接一个模型,这个直接接入四个:Gemini、ChatGPT、DeepSeek、Claude。

Daily Stock Analysis 是个近 6 万 Star 的开源项目,自动整合行情、新闻、技术指标和基本面,让多个模型交叉分析同一支股票,生成结构化报告。 用长鑫科技举例,报告会拆解出国产替代、技术差距、IPO 估值、行业周期、潜在风险五个维度,外加乐观/中性/悲观三种情景。 支持 A 股港股美股,带 WebUI、大盘复盘、自选股、历史报告,Docker 一键本地部署。

Thread

一句话生成完整短视频——

Pixelle-Video 全链路闭环:写文案、AI 生图生视频、配音、上字幕,自动吐出成品。 支持开源模型和免费 API,成本极低。 本地部署,批量生产。 一个人顶一个短视频团队。

Thread

做 RAG 踩过最多坑的地方不是模型,是文件前处理。

表单、流程图、多栏 PDF 扔进去,出来的文本全是乱的,召回自然差。 有人开源了一个专门解决这个的小工具:Semark。 把 PDF / Office / HTML / 图片转成适合知识库的 semantic Markdown——不只是 OCR,而是尽量保留表格结构、字段关系和语义层级。 基于 MinerU,可接 Ollama 或 OpenAI-compatible VLM/LLM,支持自动分档。

Thread

想免费跑 Claude Code 和 Codex?

这个项目『Free Claude Code』做了个本地代理,直接把请求路由到各种免费/本地模型上。 支持 NVIDIA NIM、Groq、Gemini、DeepSeek、OpenRouter 免费模型、Ollama、LM Studio 等 17 种后端。 有专用 fcc-claude / fcc-codex launcher,VS Code 扩展、JetBrains 也能接,还支持 Discord

Thread

他们把 FinLab 十年积累的量化知识,打包成 AI 能读懂的格式

让 Claude Code 或 Cursor 直接变成台股策略研发助手 你不用学语法,只要说:「帮我找营收增长但本益比偏低的股票」 AI 就会帮你捞数据、写策略、跑回测 推荐做法是:先用 finlab-ai 让 AI 把策略验证、回测跑完,确认可行再去 XQ 实操 几分钟就能完成手动要花好几个小时的组合测试 这是研发工具,不是印钞机 最后判断还是靠自己 但至少,能更快知道一个想法值不值得试