做 RAG 踩过最多坑的地方不是模型,是文件前处理。
做 RAG 踩过最多坑的地方不是模型,是文件前处理。
表单、流程图、多栏 PDF 扔进去,出来的文本全是乱的,召回自然差。
有人开源了一个专门解决这个的小工具:Semark。
把 PDF / Office / HTML / 图片转成适合知识库的 semantic Markdown——不只是 OCR,而是尽量保留表格结构、字段关系和语义层级。
基于 MinerU,可接 Ollama 或 OpenAI-compatible VLM/LLM,支持自动分档。
作者说是第一次整理开源项目,但这个方向真的很实用。
提到的仓库