• 제목/요약/키워드: enumerative text contents

검색결과 1건 처리시간 0.014초

문서구조 추출기법을 이용한 엔지니어링 문서 텍스트 정보의 XML 변환 (Transformation of Text Contents of Engineering Documents into an XML Document by using a Technique of Document Structure Extraction)

  • 이상호;박준원;박상일;김봉근
    • 대한토목학회논문집
    • /
    • 제31권6D호
    • /
    • pp.849-856
    • /
    • 2011
  • 본 연구에서는 교량의 구조계산서와 같이 여러 종류의 머리기호를 사용하며 제목의 계층구조가 복잡한 형식을 띄는 엔지니어링 문서의 비구조화된 텍스트 정보를 제목의 계층 구조에 따른 준구조화된 XML 문서로 변환시키는 방법을 제시한다. 텍스트 정보로부터 제목의 계층구조를 자동으로 추출하기 위해 문서구조분석 방법의 하나인 문서구조추출 기법을 이용하는 방법을 개발하였으며, 특히 개조식 구문의 식별방법을 개발하여 구조계산서 문서 계층구조의 제목추출과정 및 계층구분의 전체 정확도를 향상시킬 수 있는 방법을 제시하였다. 제시된 방법에 따른 응용모듈을 개발하였으며, 총 40개의 교량 구조계산서를 대상으로 그 성능을 평가하였다. 먼저, 20개의 강거더 상부 구조계산서를 대상으로 선행 연구결과와 비교하여 본 연구에서 개발된 응용모듈의 정확성과 신뢰도가 향상됨을 보였다. 또한, 다른 구조형식에 대한 구조계산서 20개에 대하여 개발된 모듈의 적용성을 평가하였다. 그 결과 본 연구에서 제안한 방법에 의한 문서 계층구조 분석의 최종 정확도는 평균 99% 수준 이상을 나타내고, 표준편차는 1.52로 나타나 본 연구에서 제시된 방법이 다양한 형식의 머리기호를 사용하여 제목을 구분하는 여러 엔지니어링 문서에도 적용이 가능함을 보였다.