微信扫码
与创始人交个朋友
我要投稿
MinerU 是一款由上海人工智能实验室OpenDataLab团队发布的全能、开源的文档与网页数据提取工具。它能够将包含图片、表格、公式等元素的多模态PDF文档转化为清晰、易于分析的Markdown格式,同时也支持从包含广告等干扰信息的网页中快速解析、抽取正式内容,并将其批量转化为Markdown格式。
# 1. 安装依赖
conda create -n MinerU python=3.10
conda activate MinerU
pip install -U magic-pdf[full] --extra-index-url https://wheels.myhloli.com -i https://pypi.tuna.tsinghua.edu.cn/simple
# 2. 下载模型权重文件
# 根据官方文档(https://github.com/opendatalab/MinerU/blob/master/docs/how_to_download_models_en.md)指示操作
# 3. 配置Magic-PDF
cp magic-pdf.template.json ~/magic-pdf.json
# 编辑 ~/magic-pdf.json,设置正确的模型文件路径
# 4. 开始使用
magic-pdf --help
magic-pdf -p {some_pdf} -o {some_output_dir} -m auto
# 检查您的设备是否支持Docker上的CUDA加速。
docker run --rm --gpus=all nvidia/cuda:12.1.0-base-ubuntu22.04 nvidia-smi
# 运行 docker 部署
wget https://github.com/opendatalab/MinerU/raw/master/Dockerfile
docker build -t mineru:latest .
docker run --rm -it --gpus=all mineru:latest /bin/bash
magic-pdf --help
更多使用方式,请查阅如下提供地址
53AI,企业落地应用大模型首选服务商
产品:大模型应用平台+智能体定制开发+落地咨询服务
承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2024-09-19
Qwen2.5 全链路模型体验、下载、推理、微调、部署实战!
2024-09-19
通义千问Qwen2.5开源,媲美Llama3.1-405B
2024-09-19
Qwen 2.5 开源,API 打一折
2024-09-18
OpenAI o1的开源平替版self-replay RL来了!
2024-09-18
Y Combinator 投资的开源 Cursor 替代品来了!
2024-09-18
OpenAI o1式思维链,开源模型也可以有,成功案例来了
2024-09-17
国外Agent产品如何?全面比较AutoGPT与AI Agent
2024-09-17
揭秘Agent框架:如何打造智能高效的AI应用核心
2024-08-13
2024-05-06
2024-06-12
2023-07-01
2024-07-08
2024-07-25
2024-07-11
2024-07-25
2024-07-18
2024-06-16