4 Revize fde9074e16 ... ef1ddfdabf

Autor SHA1 Zpráva Datum
  zhch158_admin ef1ddfdabf feat(新增姜_苏州银行图文档配置): 在pdf_list_local.txt中添加姜_苏州银行图.pdf,并在ocr_validator/config中新增对应的文档配置文件,定义OCR工具及结果目录,提升OCR处理的灵活性与可用性。 před 1 měsícem
  zhch158_admin 2c9eb98492 feat(更新MinerU模型版本): 修改curl_local_mineru.sh和mineru_local_daemon.sh中的模型版本,将其更新为MinerU2.5-Pro-2605-1.2B,以提升模型性能与兼容性。 před 1 měsícem
  zhch158_admin eab1585af0 feat(更新HF_safetensors到GGUF转换文档): 修改HF_safetensors->GGUF.md文档中的模型路径和输出类型,将MinerU2.5-Pro模型更新为2605版本,并将输出类型调整为q8_0,以提升模型转换的效率与兼容性。 před 1 měsícem
  zhch158_admin 263be3bb13 Stop tracking VS Code workspace file před 2 měsíci

+ 47 - 0
.gitignore

@@ -0,0 +1,47 @@
+*.tar
+*.tar.gz
+*.zip
+venv*/
+envs/
+slurm_logs/
+
+data_preprocess_pj1
+data-preparation1
+__pycache__
+*.log
+*.pyc
+debug/
+*.ipynb
+.idea
+
+# vscode history
+.history
+
+.DS_Store
+.env
+
+bad_words/
+bak/
+
+app/tests/*
+temp/
+tmp/
+tmp
+.vscode/settings.json
+ocr_demo
+.coveragerc
+/app/common/__init__.py
+/magic_pdf/config/__init__.py
+source.dev.env
+
+tmp
+
+projects/web/node_modules
+projects/web/dist
+
+projects/web_demo/web_demo/static/
+cli_debug/
+debug_utils/
+
+# sphinx docs
+_build/

+ 13 - 13
docs/ocr_tools/universal_doc_parser/HF_safetensors->GGUF.md

@@ -177,7 +177,7 @@ hf download opendatalab/MinerU2.5-Pro-2604-1.2B --local-dir ~/models/MinerU2.5-P
 # 3. 转语言模型主体(M4 48G 内存充足,直接 f16 不量化质量最好)
 python convert_hf_to_gguf.py ~/models/PaddleOCR-VL-1.6 \
     --outfile ~/models/PaddleOCR-VL-1.6-GGUF \
-    --outtype f16
+    --outtype q8_0
 
 # 4. 转视觉投影器 mmproj(OCR 质量主要看这个,建议 f16/f32)
 python convert_hf_to_gguf.py ~/models/PaddleOCR-VL-1.6 \
@@ -187,14 +187,14 @@ python convert_hf_to_gguf.py ~/models/PaddleOCR-VL-1.6 \
 cp ~/models/PaddleOCR-VL-1.6/chat_template.jinja ~/models/PaddleOCR-VL-1.6-GGUF/chat_template.jinja
 
 # 5. 转语言模型主体(M4 48G 内存充足,直接 f16 不量化质量最好)
-python convert_hf_to_gguf.py ~/models/MinerU2.5-Pro-2604-1.2B \
-    --outfile ~/models/MinerU2.5-Pro-2604-1.2B-GGUF \
-    --outtype f16
+python convert_hf_to_gguf.py ~/models/MinerU2.5-Pro-2605-1.2B \
+    --outfile ~/models/MinerU2.5-Pro-2605-1.2B-GGUF \
+    --outtype q8_0
 
 # 6. 转视觉投影器 mmproj(OCR 质量主要看这个,建议 f16/f32)
-python convert_hf_to_gguf.py ~/models/MinerU2.5-Pro-2604-1.2B \
+python convert_hf_to_gguf.py ~/models/MinerU2.5-Pro-2605-1.2B \
     --mmproj \
-    --outfile ~/models/MinerU2.5-Pro-2604-1.2B-GGUF/MinerU2.5-Pro-2604-1.2B-mmproj.gguf \
+    --outfile ~/models/MinerU2.5-Pro-2605-1.2B-GGUF/MinerU2.5-Pro-2605-1.2B-mmproj.gguf \
     --outtype f16
 cp ~/models/MinerU2.5-Pro-2604-1.2B/chat_template.jinja ~/models/MinerU2.5-Pro-2604-1.2B-GGUF/chat_template.jinja
 
@@ -262,7 +262,7 @@ ocr_tools/daemons/curl_local_mineru.sh
 conda activate mineru
 python - <<'PY'
 import json, os
-d = os.path.expanduser("~/models/MinerU2.5-Pro-2604-1.2B")
+d = os.path.expanduser("~/models/MinerU2.5-Pro-2605-1.2B")
 otsl = {"<ched>", "<ecel>", "<fcel>", "<lcel>", "<ucel>", "<xcel>", "<nl>"}
 
 # 1) tokenizer.json:convert_hf_to_gguf 据此决定 token 类型(关键)
@@ -286,8 +286,8 @@ print("已将 OTSL token 标记为非 special,可重新转换主模型 GGUF")
 PY
 
 # 重转主模型(mmproj 不用动)
-python convert_hf_to_gguf.py ~/models/MinerU2.5-Pro-2604-1.2B \
-    --outfile ~/models/MinerU2.5-Pro-2604-1.2B-GGUF \
+python convert_hf_to_gguf.py ~/models/MinerU2.5-Pro-2605-1.2B \
+    --outfile ~/models/MinerU2.5-Pro-2605-1.2B-GGUF \
     --outtype f16
 ```
 
@@ -332,8 +332,8 @@ f32 / f16 / bf16 / q8_0 / tq1_0 / tq2_0 / auto
 `q8_0` 在列,所以一步直出没问题:
 
 ```bash
-python convert_hf_to_gguf.py ~/models/MinerU2.5-Pro-2604-1.2B \
-    --outfile ~/models/MinerU2.5-Pro-2604-1.2B-GGUF \
+python convert_hf_to_gguf.py ~/models/MinerU2.5-Pro-2605-1.2B \
+    --outfile ~/models/MinerU2.5-Pro-2605-1.2B-GGUF \
     --outtype q8_0
 # mmproj 仍单独转、保持 f16(见前面步骤)
 ```
@@ -356,8 +356,8 @@ LLAMA_BIN="$HOME/workspace/repository.git/llama.cpp/build/bin"
 
 # MinerU2.5:只量化语言主体,mmproj 保持 f16 不动
 "$LLAMA_BIN/llama-quantize" \
-    ~/models/MinerU2.5-Pro-2604-1.2B-GGUF/MinerU2.5-Pro-2604-1.2B-F16.gguf \
-    ~/models/MinerU2.5-Pro-2604-1.2B-GGUF/MinerU2.5-Pro-2604-1.2B-Q8_0.gguf \
+    ~/models/MinerU2.5-Pro-2605-1.2B-GGUF/MinerU2.5-Pro-2605-1.2B-F16.gguf \
+    ~/models/MinerU2.5-Pro-2605-1.2B-GGUF/MinerU2.5-Pro-2605-1.2B-Q8_0.gguf \
     Q8_0
 
 # PaddleOCR-VL-1.6:同理

+ 0 - 17
ocr_platform.code-workspace

@@ -1,17 +0,0 @@
-{
-	"folders": [
-		{
-			"name": "ocr_platform",
-			"path": "."
-		},
-		{
-			"name": "MinerU",
-			"path": "../MinerU"
-		},
-		{
-			"name": "data",
-			"path": "../../data"
-		}
-	],
-	"settings": {}
-}

+ 1 - 1
ocr_tools/daemons/curl_local_mineru.sh

@@ -3,7 +3,7 @@
 curl http://127.0.0.1:8103/v1/chat/completions \
   -H "Content-Type: application/json" \
   -d '{
-    "model": "MinerU2.5-Pro-2604-1.2B",
+    "model": "MinerU2.5-Pro-2605-1.2B",
     "messages": [
       {
         "role": "user",

+ 7 - 7
ocr_tools/daemons/mineru_local_daemon.sh

@@ -2,10 +2,10 @@
 # filepath: ocr_platform/ocr_tools/daemons/mineru_local_daemon.sh
 # 对应: MinerU2.5-Pro 本地 llama-server 服务(macOS),使用 GGUF 格式模型
 # 适用于 Mac M4 Pro 48G,使用 Metal GPU 加速
-# 模型下载地址: https://huggingface.co/mradermacher/MinerU2.5-Pro-2604-1.2B-GGUF
+# 模型下载地址: https://huggingface.co/mradermacher/MinerU2.5-Pro-2605-1.2B-GGUF
 #
 # 首次下载方式(自动下载 Q8_0 量化版本):
-#   llama-server -hf mradermacher/MinerU2.5-Pro-2604-1.2B-GGUF:Q8_0
+#   llama-server -hf mradermacher/MinerU2.5-Pro-2605-1.2B-GGUF:Q8_0
 # 模型会缓存到 ~/Library/Caches/llama.cpp/,也可手动移至 ~/models/mineru_vl/
 
 # curl -X POST http://localhost:8103/v1/chat/completions -d @payload.json
@@ -23,13 +23,13 @@ PORT="8103"
 HOST="0.0.0.0"
 
 # 本地 GGUF 模型路径(llama-server -hf 下载后的实际路径)
-HF_CACHE="$HOME/models/MinerU2.5-Pro-2604-1.2B-GGUF"
-# MODEL_PATH="$HF_CACHE/MinerU2.5-Pro-2604-1.2B-F16.gguf"
-MODEL_PATH="$HF_CACHE/MinerU2.5-Pro-2604-1.2B-Q8_0.gguf"
-MMPROJ_PATH="$HF_CACHE/MinerU2.5-Pro-2604-1.2B-F16-mmproj.gguf"
+HF_CACHE="$HOME/models/MinerU2.5-Pro-2605-1.2B-GGUF"
+# MODEL_PATH="$HF_CACHE/MinerU2.5-Pro-2605-1.2B-F16.gguf"
+MODEL_PATH="$HF_CACHE/MinerU2.5-Pro-2605-1.2B-Q8_0.gguf"
+MMPROJ_PATH="$HF_CACHE/MinerU2.5-Pro-2605-1.2B-F16-mmproj.gguf"
 
 # 模型别名(对外暴露的模型 ID,对应 yaml 中的 model 字段)
-MODEL_NAME="MinerU2.5-Pro-2604-1.2B"
+MODEL_NAME="MinerU2.5-Pro-2605-1.2B"
 
 # llama-server 执行文件
 LLAMA_SERVER_EXECUTABLE="/Users/zhch158/workspace/repository.git/llama.cpp/build/bin/llama-server"

+ 1 - 0
ocr_tools/ocr_batch/pdf_list_local.txt

@@ -2,3 +2,4 @@
 陈3_微信图.pdf,bank_statement
 彭_广东兴宁农村商业银行.pdf,bank_statement
 钟_广东陆丰农村商业银行.pdf,bank_statement
+姜_苏州银行图.pdf,bank_statement

+ 2 - 1
ocr_validator/config/global.yaml

@@ -165,4 +165,5 @@ data_sources:
   # - 严_农业银行.yaml
   - 陈3_微信图.yaml
   - 彭_广东兴宁农村商业银行.yaml
-  - 钟_广东陆丰农村商业银行.yaml
+  - 钟_广东陆丰农村商业银行.yaml
+  - 姜_苏州银行图.yaml

+ 34 - 0
ocr_validator/config/姜_苏州银行图.yaml

@@ -0,0 +1,34 @@
+# 文档: 彭_广东兴宁农村商业银行
+document:
+  name: "姜_苏州银行图"
+  base_dir: "/Users/zhch158/workspace/data/流水分析/姜_苏州银行图"
+  
+  # 🎯 关键改进:定义该文档使用的 OCR 工具及其结果目录
+  ocr_results:
+    # bank_statement_yusys_local
+    - tool: "mineru"
+      result_dir: "bank_statement_yusys_local"
+      image_dir: "bank_statement_yusys_local/{{name}}"
+      description: "YUSYS-OCR框架(local) Wired UNET OCR GLM-OCR"
+      enabled: true
+
+    # # bank_statement_glmocr_local
+    # - tool: "mineru"
+    #   result_dir: "bank_statement_yusys_glmocr_local"
+    #   image_dir: "bank_statement_yusys_glmocr_local/{{name}}"
+    #   description: "YUSYS-OCR框架(local) GLM-OCR VLM"
+    #   enabled: true
+
+    # # bank_statement_paddleocr_local
+    # - tool: "mineru"
+    #   result_dir: "bank_statement_yusys_paddleocr_local"
+    #   image_dir: "bank_statement_yusys_paddleocr_local/{{name}}"
+    #   description: "YUSYS-OCR框架(local) PaddleOCR VLM"
+    #   enabled: true
+
+    # bank_statement_mineruocr_local
+    - tool: "mineru"
+      result_dir: "bank_statement_yusys_mineruocr_local"
+      image_dir: "bank_statement_yusys_mineruocr_local/{{name}}"
+      description: "YUSYS-OCR框架(local) MinerU-VL"
+      enabled: true