diff --git a/README.md b/README.md index d8900ad..3929062 100644 --- a/README.md +++ b/README.md @@ -1,9 +1,24 @@ ```bash python -m venv paddle source paddle/bin/activate -pip install -r deploy/requirements +pip install -r requirements.txt mkdir pretrained_models/ cd pretrained_models/ wget https://paddle-model-ecology.bj.bcebos.com/paddlex/official_pretrained_model/PP-OCRv5_server_rec_pretrained.pdparams cd .. +mkdir train_data/ +cd train_data/ +``` + +Далее положите датасет custom-ocr-dataset.zip в папку train_data и далее выполните: + +```bash +unzip custom-ocr-dataset.zip +rm custom-ocr-dataset.zip +cd .. +``` + +Запустите процесс валидации: +```bash +python tools/eval.py -c configs/rec_custom.yml ``` diff --git a/configs/rec_custom.yml b/configs/rec_custom.yml index dd7c01d..ce79488 100644 --- a/configs/rec_custom.yml +++ b/configs/rec_custom.yml @@ -1,8 +1,8 @@ Global: - use_gpu: true - character_dict_path: /kaggle/input/custom-ocr-dataset/dict.txt + use_gpu: false + character_dict_path: train_data/dict.txt save_model_dir: ./output/ - pretrained_model: /kaggle/working/PaddleOCR/pretrained_models/PP-OCRv5_server_rec_pretrained.pdparams + pretrained_model: pretrained_models/PP-OCRv5_server_rec_pretrained.pdparams Architecture: model_type: rec @@ -38,9 +38,9 @@ Metric: Train: dataset: name: SimpleDataSet - data_dir: /kaggle/input/custom-ocr-dataset + data_dir: train_data/ label_file_list: - - /kaggle/input/custom-ocr-dataset/train.txt + - train_data/train.txt loader: batch_size_per_card: 16 # Уменьшите для экономии памяти num_workers: 2 @@ -48,9 +48,9 @@ Train: Eval: dataset: name: SimpleDataSet - data_dir: /kaggle/input/custom-ocr-dataset + data_dir: train_data/ label_file_list: - - /kaggle/input/custom-ocr-dataset/val.txt + - train_data/val.txt transforms: - DecodeImage: img_mode: BGR diff --git a/deploy/requirements.txt b/deploy/requirements.txt deleted file mode 100644 index 9e11f32..0000000 --- a/deploy/requirements.txt +++ /dev/null @@ -1,6 +0,0 @@ -# paddlepaddle-gpu -paddlepaddle -paddleocr -imgaug -lmdb -rapidfuzz diff --git a/requirements.txt b/requirements.txt index 7fc903c..e509c83 100644 --- a/requirements.txt +++ b/requirements.txt @@ -15,3 +15,10 @@ albumentations # to be compatible with albumentations albucore packaging +# paddlepaddle-gpu +paddlepaddle +paddleocr +imgaug +lmdb +rapidfuzz +setuptools