下载

解压就是全部安装过程

包里自带精简 Java 运行时,不用另装 Java,也不用装 Python。转换全程在本机完成。

macOS Apple Silicon · arm64 下载 .dmg v1.0.2 · 121 MB · 已签名并公证
macOS Intel · x86_64 下载 .dmg v1.0.2 · 122 MB · 已签名并公证
Windows x64 下载 .zip v1.0.2 · 116 MB · 未签名

首次运行。macOS 包已用 Developer ID 签名并经 Apple 公证,双击直接打开,不会被拦。 Windows 包未签名,第一次运行 SmartScreen 会提示一次:点「更多信息」→「仍要运行」即可,之后不再提示。

包里有什么

四个程序
命令行、图形界面、Web 常驻服务、MCP Server,共用同一份依赖
Java 运行时
用 jlink 裁过的精简运行时,只带用得到的模块
工作目录
raw/(放待转文件)、output/(产物)、config.toml(默认参数)都在可执行文件旁边
不含
OCR 服务。它依赖较重(几个 GB),按需单独装,见下

用 pip 安装

需要 Python 3.10 或更高、Java 11 或更高。Java 是必需的——真正做版面分析的引擎是 Java 写的。

$ pip install "aimorsel[all]"   # [all] = docx/xlsx/pptx/图片输入 + GUI 拖拽 + 坏 PDF 修复
$ java -version                 # 确认 Java 在
$ morsel --version

包名是 aimorselPyPI);pip install morsel 是它的别名,装到的是同一个包。 装完就有 morsel 命令,morsel gui / morsel web / morsel mcp 起另外三个程序。

从源码安装

$ git clone https://github.com/aimorsel/aimorsel.git
$ cd aimorsel
$ pip install -e ".[all]"
$ morsel --version

必装的只有核心引擎和兜底网,其余都是可选 extras:缺哪个只影响对应功能,报错里会直接给出安装命令。 HTML 输入用标准库解析,不需要额外装东西。

扫描件与图片:另装 OCR

扫描件和图片没有文字层,要出文字得先装一次 OCR 服务。它是一个跑在本机的独立服务, 依赖装在单独的环境里,不污染系统,卸载就是删掉那个目录。

$ morsel --setup-ocr              # 建环境、装依赖、启动服务
$ morsel --setup-ocr-lang "de,en" # 按文档语言指定
$ morsel --stop-ocr

语言要对得上。实测中影响识别质量最大的因素就是这个: 用中文模型识别德语文档,变音符号会全错、丢行严重,换成 de,en 后明显改善。 一批多语言文档需要按语言分批处理。

先知道这些限制

  • 扫描件 OCR 适合检索和定位,不适合当忠实全文。印刷体正文可靠, 但数学公式基本丢失、手写标记基本忽略,过小的字号会丢行。
  • 无边框表格的识别有限。底层默认靠边框找表格,遇到无边框表格要开增强表格识别。
  • PDF 里字体编码映射坏掉时会出乱码,这属于源文件的问题,解析引擎无能为力。
  • Web 服务没有访问控制,默认只绑本机,别暴露到不可信网络。