想自己拉航班比价数据?有个开源 flights 爬虫走 Google Flights 协议层。
技术点在 Protobuf 编码,不是简单 HTML 刮。 研究向,合规与频率自己把关。 链接放评论。
一个工具诞生的理由很朴素:作者不想每月付 16 美元给爬虫软件公司,自己写了一个。
结果做出来的是专为 AI 场景设计的爬虫——任意复杂网页一键提纯成干净的 Markdown,直接喂给 LLM 跑数据流水线,不用注册、不要 API Key、不按页扣费。 评论区有意思的地方是:有人说这类工具前两年就有了,推荐了付费的 Firecrawl;也有人说作者本来就是不爽 Firecrawl 收费才写的这个——虽然 Firecrawl 现在也有开源版了。 省钱驱动出来的项目,往往比「为了创业
别再让 Agent 死等 OCR。
Firecrawl 开源 pdf-inspector: - 20ms 级分类 - 直接抽 Markdown - 200 份约 2.8 秒 - Rust,表格图表友好 Agent 读文档,终于不那么卡。
一个 $16 账单,逼出了 6 万星开源爬虫。
Unclecode 被「付费开源」工具激怒,几天写出 Crawl4AI:免费、无限次、本机跑,比 Firecrawl 快约 6 倍。 适合谁: · RAG:爬文档喂模型 · 竞品监控:自动抓价格 · 学术:爬论文转结构化数据 月费 0 元 vs Firecrawl $19–500。你付钱,还是花几天自己 build?
一个 $16 账单,逼出了 6 万星开源爬虫。
Unclecode 被「付费开源」工具激怒,几天写出 Crawl4AI:免费、无限次、本机跑,比 Firecrawl 快约 6 倍。 适合谁: · RAG:爬文档喂模型 · 竞品监控:自动抓价格 · 学术:爬论文转结构化数据 月费 0 元 vs Firecrawl $19–500。你付钱,还是花几天自己 build?
开源 Skills 精选 6 个(可直接装):
📱 微信本地解析:聊天/通讯录/收藏/朋友圈 🏢 企微聊天记录解析 ✍️ Markdown → X 长文章(表格段落丝滑) 🧠 Codex/Claude 共用记忆(可编辑 MD) 🎬 抖音视频抓取(免登录) 📕 小红书视频/图文 → 飞书多维表 仓库:https://github.com/mcncarl/yichen-skills 微信本地:https://github.com/mcnc
AI Agent 终于可以免费上网搜索了。
wigolo:本地优先的 MCP 服务器,给 AI agent 完整的网络搜索和抓取能力,零 API 费用。 - 18 个搜索引擎同时跑 - 自动抓取和解析网页 - 本地 ML 重排序 - 结果自动缓存 - 遇到反爬网站自动切换无头浏览器 $0/次查询,不需要任何 API key。
RAG 最头疼的脏数据:扫描件、公式、跨页表格。
MinerU 专门处理这个——复杂 PDF / Office 文档一键转成干净的 Markdown / JSON,直接喂给 LangChain、LlamaIndex。 VLM + OCR 双引擎,公式转 LaTeX,表格转 HTML,自动去页眉页脚,109 种语言,可纯本地离线。 OmniDocBench 95.4 分,GitHub 69.7k Star。
爬小红书、抖音、B站最头疼的是各家加密签名不一样,得逐个逆向 JS。
MediaCrawler 绕过这个问题——基于 Playwright 复用已登录的浏览器直接拿签名参数,不用逆向。 小红书、抖音、快手、B站、微博、贴吧、知乎,一套接口全覆盖。支持关键词搜索、评论抓取、创作者主页、评论词云生成。 GitHub 53.2k Star。
公众号写作的完整 AI 流水线。
WeWrite:一句话「写一篇公众号文章」,自动抓取热点、选题打分、框架生成、采集真实信息、SEO 优化、AI 配图、微信排版,最后直推草稿箱。 支持 Claude Code 和 OpenClaw,留编辑锚点 + 风格学习。
PDF 转 Markdown,我测了 6 个方案,结论是:
表格要求高 → Mistral OCR,直接输出 md 表格,扫描件也行,还免费 本地工具: - pdf2md:快,表格看来源 - pdfplumber:精度高,得自己写 parser - MarkItDown:表格烂 云端 API: - Mistral OCR:表格稳 - Google Vision:纯文字,没结构 - Firecrawl:表格烂 没有表格需求就用 pdf2md,够快够省。
说个骚操作,做竞品调研、写报告、喂给 AI 的时候用:
Firecrawl 可以直接把网站抓下来,转成 Markdown 或结构化数据。 不用一页一页复制粘贴,打包好直接送到 Claude Code 或 Codex 嘴边。 以前是人给 AI 喂数据,现在是工具替你喂。
MediaCrawler 是国内社媒采集工具,适合做样本池。
小红书、抖音、B站、微博这些平台,手动看可以找灵感,但做分析一定不够。 跟 Playwright 比,它更贴近具体平台;跟 f2 比,它更偏社媒数据和内容研究。 有样本才叫判断,没样本多数是在凭感觉算命。
小红书严打爬虫和 AI 生成内容。
其实正确姿势很简单:像人一样浏览,就不违规。 GitHub 开源项目 Socai(tonyc-ship/socai),小红书调研 Agent。不是爬虫——通过 Chrome Extension 连接你已登录的浏览器,用真实的搜索、点击、阅读动作做调研,生成报告。 三条常用命令: socai search_notes "露营装备营销文案" socai extract_note --note-id <