From 93e467933a7eec84341ed08f694f00545397b29d Mon Sep 17 00:00:00 2001 From: lukaszmalinowski14 Date: Thu, 17 Aug 2023 13:51:31 +0200 Subject: [PATCH] "DFSDF" --- langdata/okfonts.txt | 1 + run.py | 3 +++ split_training_text.py | 15 ++++++++------- tesseract | 2 +- 4 files changed, 13 insertions(+), 8 deletions(-) create mode 100644 run.py diff --git a/langdata/okfonts.txt b/langdata/okfonts.txt index 164279b..889129c 100644 --- a/langdata/okfonts.txt +++ b/langdata/okfonts.txt @@ -690,6 +690,7 @@ BPG Chveulebrivi Bold BPG Chveulebrivi Regular BPG Courier Bold BPG Courier Regular +BPG CourierETT BPG Elite Bold BPG Elite Regular BPG Glaho Bold diff --git a/run.py b/run.py new file mode 100644 index 0000000..94e8875 --- /dev/null +++ b/run.py @@ -0,0 +1,3 @@ +import os +os.environ["TESSDATA_PREFIX"] = "C:/Python/ocr_10/tesseract_tutorial/tesseract/tessdata make training MODEL_NAME=Courier START_MODEL=eng TESSDATA=C:/Python/ocr_10/tesseract_tutorial/tesseract/tessdata MAX_ITERATIONS=100" +print("END") diff --git a/split_training_text.py b/split_training_text.py index 04049c1..ce8bbcb 100755 --- a/split_training_text.py +++ b/split_training_text.py @@ -7,11 +7,12 @@ lines = [] -with open(training_text_file, 'r') as input_file: +with open(training_text_file, 'r', encoding="utf-8") as input_file: for line in input_file.readlines(): lines.append(line.strip()) -output_directory = 'tesstrain/data/Apex-ground-truth' +# output_directory = 'tesstrain/data/Apex-ground-truth' +output_directory = 'tesstrain/data/CourierETT-ground-truth' if not os.path.exists(output_directory): os.mkdir(output_directory) @@ -19,21 +20,21 @@ random.shuffle(lines) count = 100 - lines = lines[:count] - line_count = 0 for line in lines: training_text_file_name = pathlib.Path(training_text_file).stem - line_training_text = os.path.join(output_directory, f'{training_text_file_name}_{line_count}.gt.txt') - with open(line_training_text, 'w') as output_file: + line_training_text = os.path.join( + output_directory, f'{training_text_file_name}_{line_count}.gt.txt') + with open(line_training_text, 'w', encoding="utf-8") as output_file: output_file.writelines([line]) file_base_name = f'eng_{line_count}' subprocess.run([ 'text2image', - '--font=Apex', + # '--font=Apex', + '--font=CourierETT', f'--text={line_training_text}', f'--outputbase={output_directory}/{file_base_name}', '--max_pages=1', diff --git a/tesseract b/tesseract index aee19fc..c3edb43 160000 --- a/tesseract +++ b/tesseract @@ -1 +1 @@ -Subproject commit aee19fcf8eb832bb9b6a67ada671d3e7679abeac +Subproject commit c3edb4352bf43367b23b28b130570cb8c4b3b5e7