Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
1 change: 1 addition & 0 deletions langdata/okfonts.txt
Original file line number Diff line number Diff line change
Expand Up @@ -690,6 +690,7 @@ BPG Chveulebrivi Bold
BPG Chveulebrivi Regular
BPG Courier Bold
BPG Courier Regular
BPG CourierETT
BPG Elite Bold
BPG Elite Regular
BPG Glaho Bold
Expand Down
3 changes: 3 additions & 0 deletions run.py
Original file line number Diff line number Diff line change
@@ -0,0 +1,3 @@
import os
os.environ["TESSDATA_PREFIX"] = "C:/Python/ocr_10/tesseract_tutorial/tesseract/tessdata make training MODEL_NAME=Courier START_MODEL=eng TESSDATA=C:/Python/ocr_10/tesseract_tutorial/tesseract/tessdata MAX_ITERATIONS=100"
print("END")
15 changes: 8 additions & 7 deletions split_training_text.py
Original file line number Diff line number Diff line change
Expand Up @@ -7,33 +7,34 @@

lines = []

with open(training_text_file, 'r') as input_file:
with open(training_text_file, 'r', encoding="utf-8") as input_file:
for line in input_file.readlines():
lines.append(line.strip())

output_directory = 'tesstrain/data/Apex-ground-truth'
# output_directory = 'tesstrain/data/Apex-ground-truth'
output_directory = 'tesstrain/data/CourierETT-ground-truth'

if not os.path.exists(output_directory):
os.mkdir(output_directory)

random.shuffle(lines)

count = 100

lines = lines[:count]

line_count = 0
for line in lines:
training_text_file_name = pathlib.Path(training_text_file).stem
line_training_text = os.path.join(output_directory, f'{training_text_file_name}_{line_count}.gt.txt')
with open(line_training_text, 'w') as output_file:
line_training_text = os.path.join(
output_directory, f'{training_text_file_name}_{line_count}.gt.txt')
with open(line_training_text, 'w', encoding="utf-8") as output_file:
output_file.writelines([line])

file_base_name = f'eng_{line_count}'

subprocess.run([
'text2image',
'--font=Apex',
# '--font=Apex',
'--font=CourierETT',
f'--text={line_training_text}',
f'--outputbase={output_directory}/{file_base_name}',
'--max_pages=1',
Expand Down
2 changes: 1 addition & 1 deletion tesseract
Submodule tesseract updated 712 files