Skip to content

Add enterprise blog HTML extraction and stricter ECL errors - #30

Open
hyeonseo2 wants to merge 2 commits into
mainfrom
feat/enterprise-html-translation
Open

Add enterprise blog HTML extraction and stricter ECL errors#30
hyeonseo2 wants to merge 2 commits into
mainfrom
feat/enterprise-html-translation

Conversation

@hyeonseo2

Copy link
Copy Markdown
Collaborator

요약

원본 Markdown을 제공하지 않는 Hugging Face Enterprise Article도 번역 플로우에서 처리할 수 있도록 HTML 기반 source Markdown 추출 경로를 추가했습니다.

GitHub Actions의 일일 번역 워크플로우에서는 --enterprise-source html을 사용하도록 설정해, raw Markdown이 없는 Enterprise Article을 기본 skip하지 않고 렌더링된 HTML에서 번역 소스를 생성합니다.

또한 ECL 번역 파이프라인에서 모델 응답 파싱 실패나 일부 블록 누락이 발생했을 때 원문 English block을 그대로 섞어 출력하지 않고 즉시 실패하도록 변경했습니다.

주요 변경 사항

  • --enterprise-source 옵션 추가
    • skip: 기존처럼 raw Markdown이 없는 Enterprise Article을 건너뜀
    • html: Enterprise Article의 렌더링된 HTML에서 source Markdown 합성
  • GitHub Actions 일일 번역 실행에 --enterprise-source html 적용
  • HTML source 합성 시 title, date, thumbnail, author, source_extraction: html 기록
  • manifest와 run summary에 source extraction 방식 기록
  • HTML 변환에서 이미지와 테이블 보존
  • Hugging Face avatar 이미지와 페이지 UI 요소 제외
  • ECL 번역 결과가 JSON으로 파싱되지 않거나 일부 block id가 누락되면 실패 처리
  • 테스트가 새 enterprise_source 인자와 호환되도록 수정

번경 영향도

  • 일일 번역 GitHub Actions는 Enterprise Article을 HTML 기반으로 처리합니다.
  • Community Article은 기존 정책대로 계속 skip합니다.
  • raw Markdown이 있는 일반 블로그 글은 기존 Markdown 소스를 우선 사용합니다.
  • 불완전한 모델 응답이 원문 문단을 포함한 번역 결과로 이어지는 문제를 방지합니다.

테스트

image

@Jwaminju

Copy link
Copy Markdown
Collaborator

LGTM 입니다! 늦게 리뷰해서 죄송합니다! HTML까지 번역되니 좋습니다 :)

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants