• 제목/요약/키워드: 추출표

검색결과 459건 처리시간 0.026초

기계학습과 규칙 기반 접근 방법을 결합한 의미 있는 표 구분과 헤드 영역 추출 (Extracting Web-Table Information Using Decision Tree and Rule Based Approach)

  • 정성원;박대원;권혁철
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2004년도 제16회 한글.언어.인지 한술대회
    • /
    • pp.5-11
    • /
    • 2004
  • 일반적으로 HTML문서는 크게 내용과 구조로 이루어져 있다. HTML은 일반 문서와 달리 태그라는 것으로 문서에 추가 정보를 주며, 문서의 내용을 더욱 명확하게 한다. 따라서 태그를 이용하면 일반 문서보다 정보를 쉽게 구별하고 추출할 수 있다. 이러한 여러 가지 태그들 중에서 본 연구는 표를 중점적으로 연구한다. 표는 행과 열을 이용하여 어떤 사실을 조직하여 전달하는 것으로, 다른 구조적 특성들 보다 정보를 조직하는데 매우 유용하며, 글로 기술할 많은 분량을 간단히 줄이는 역할을 한다. 이와 같은 표의 특성에 주목하여 표에서 정보를 추출하는 분야를 기존 연구자들은 Web Table Mining 명명하였다. 본 연구는 기존 연구자들이 간과한 표의 구조적인 특성을 이용하여 전체 인터넷 문서에 적용할 수 있는 방법과 함께, 표에서 의미 있는 정보 추출을 위한 단계적인 모형을 제시한다.

  • PDF

웹상의 표에서 머리와 몸체 분리 방안 연구 (Separating Head from Body in Web-Tables)

  • 정성원;권혁철
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2005년도 제17회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.50-56
    • /
    • 2005
  • 본 논문은, 웹상의 표에서 유용한 정보를 뽑기 위하여 표 머릿부분과 몸체부분을 효과적으로 분리하는 방안을 제안한다. 웹상의 표로부터 정보를 뽑기 위해서는 웹상의 표를 기계가 해석할 수 있는 형태, 즉 속성-값의 쌍으로 변환해야 한다. 이중 속성은 보통 표 머리에 해당하며, 그에 해당하는 값은 표 몸체에 해당하는데, 이는 머리가 해당 몸체 부분을 대표하여 나타내는 단어이기 때문이다. 본 연구의 선행 연구에서는 인터넷상의 표가 표 본래의 정보 전달을 위한 목적 이외에 인터넷 문서의 정렬이나 구조화를 목적으로 쓰이는 경우가 많으므로 이러한 표를 제거하고 표 본래의 의미를 전달하는 표(의미 있는 표)만 추출하는 연구를 하였다 본 연구에서는 이를 바탕으로 의미 있는 표에서 표 머리와 몸체를 분리하기 위한 휴리스틱에 기반을 둔 모델을 제안한다. 이를 위하여, 표의 본래 특성과, 표를 작성하는 저자의 작성 습관을 관찰하여 머리와 몸체를 분리하기 위한 방안을 설정하고, 이 방안들을 결합하는 모델을 구축한다. 본 연구에서는 이 결과로 80.3%의 표 머리 추출 정확도를 얻을 수 있었다.

  • PDF

문서영상에서 표 구성 직선과 데이터 추출 (The Extraction of Table Lines and Data in Document Image)

  • 장대근;김의정
    • 한국정보통신학회논문지
    • /
    • 제10권3호
    • /
    • pp.556-563
    • /
    • 2006
  • 문서 영상에서 표 영역을 분류하고 구조를 파악하려면 표를 구성하는 직선과 데이터를 추출할 수 있어야 한다. 그러나 영상 입력 장치의 오차나 영상축소로 인해 표를 구성하는 직선이 끊어지거나 길이가 변하며 직선에 노이즈나 문자가 붙어 표로부터 직선과 데이터의 정확한 추출이 어렵다. 본 논문에서 는 1차원 메디안 필터를 이용하여 표를 구성하는 수평선과 수직선을 추출한다. 1차원 메디안 필터는 필터링 방향의 직선을 추출하는 과정에서 노이즈와 필터링 방향에 수직한 직선을 제거할 뿐 아니라 직선의 끊어진 부분이 필터 탭 길이보다 짧은 경우 끊어진 부분을 연결한다. 또한 수직선을 추출하는 과정에서 직선에 붙어 있던 문자들을 분리함으로써 상용제품을 포함한 기존의 방법에 비해 표 영역 분류 및 구조 분석을 위한 직선과 데이터 추출이 우수한 방법을 제안한다.

웹 문서 중 의미 있는 표의 추출 (Extraction of Meaningful Tables from The Web Documents)

  • 정성원;이원희;김영기;권혁철
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2002년도 제14회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.332-339
    • /
    • 2002
  • 현재까지 정보 검색 시스템은 색인어 위주로써 문서의 구조적 정보를 고려하지 알았다. 글자의 크기나 글자체, 들여 쓰기, 표 등은 저자의 의도를 구체화하며, 문서를 명확하게 하는 주요한 수단이다. 이 연구에서는 특히 표에 주목한다. 표는 많은 문서에 일반적으로 쓰이며, 글을 명확하게 해 준다. 일반 문서에 비해서 웹 문서는 태그를 이용하여 정보를 추가할 수 있어 표를 쉽게 구분할 수 있다. 하지만, 웹 상의 표는 지식을 구조화하는 근본적인 목적이외에, 단순히 화면을 정렬하려고 하는 목적으로도 많이 쓰인다. 이 연구에서는 정보 검색시스템에 표 정보를 사용하기 위한 전처리 단계로 의미 있는 표를 추출하는 방법을 제시하며, 이를 위하여 결정 트리를 사용한다.

  • PDF

붓스트랩방법의 실제적활용1) -군집표본추출법에 근거한 분할표분석을 중심으로

  • 전명식
    • Communications for Statistical Applications and Methods
    • /
    • 제3권1호
    • /
    • pp.179-188
    • /
    • 1996
  • 복합조사표본추출법(complex survey sampling)에 근거한 분할표분석에 카이제곱검정법을 사용할 때의 문제점들과 해결방법들을 살펴보았다. 나아가, 군집표본추출의 경우에 붓스트랩방법의 타당성을 보였으며, 실제자료분석을 통하여 실제 활용가능성과 잇점을 제시하였다.

  • PDF

표 방법을 이용한 한국어 공간 관계 추출의 상한 계산 (Upper Bound of Tabular Method for Korean Spatial Relation Extraction)

  • 민태홍;이재성
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2018년도 제30회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.301-304
    • /
    • 2018
  • 기존의 공간 관계 추출은 관계 속성 추출 후 적합한 개체와의 관계 형성이 불명확한 점과 한 개체가 다중관계에 속할 때 관계 형성이 불확실한 문제가 있다. 이를 해결하기 위하여 본 논문은 최근 개체명 관계 추출에서 사용하는 표 방법을 공간 관계 추출에 적용하였다. 기존 모델과 제안 모델을 비교하기 위하여 상한 성능을 측정하였으며, 그 결과 제안 모델이 더 우수함을 보였다.

  • PDF

Table parsing을 이용한 정보검색시스템의 효율향상 (Implementation of Information Retrieval System by Table-parsing)

  • 김영순;권혁철
    • 한국멀티미디어학회:학술대회논문집
    • /
    • 한국멀티미디어학회 2001년도 추계학술발표논문집
    • /
    • pp.413-416
    • /
    • 2001
  • 인터넷 문서에서 구조정보의 대표적인 예라 할 수 있는 표(table)는 의미있는 정보를 가지고 있는 경우가 많다. 하지만 인터넷상의 표는 여러 가지 형태이며, 이것에 맞게 표를 효과적으로 parsing하는 방법이 필요하다. 이렇게 parsing한 표의 정보를 이용하여, 인터넷 문서, 특히 전자상거래 문서에 있는 표를 표준화한 틀에 따라 개념화하여, 의미있는 정보를 추출해 낼 수 있다.

  • PDF

단계별로 얻어진 이차원 분할표의 모수 추정을 위한 정확최대우도추정법과 단계별추출추정법의 비교 (Comparison of Step-Wise and Exact Maximum Likelihood Estimations on Cell Probabilities of Contingency Table)

  • 이상은;강기훈;정석오;신기일
    • Communications for Statistical Applications and Methods
    • /
    • 제17권1호
    • /
    • pp.67-77
    • /
    • 2010
  • 단계별로 얻어진 $I{\times}J$ 이차원 범주형 자료에서 분할표 일부의 칸에서 도수가 붕괴(collapse)된 상태로 조사가 이루어진 것을 단계별추출(step-wise sampling)이라 한다. 단계별추출로 얻어진 자료를 분석할 경우 단계별추출법을 사용하여 분석하면 분석의 효과를 얻을 수 있다. 본 논문에서는 단계별추출법 중에서 최대우도추정법을 이용하여 얻어진 정확최대우도추정량(exact maximum likelihood estimator)과 단계별추출최대우도추정량을 연구하였다. 또한 MSE와 편향(bias)을 기준으로 모의실험을 통하여 두 추정법을 비교하였다.

표고 자실체 물 추출물과 베타글루칸이 한우 근육위성세포 증식에 미치는 영향 (Effect of Lentinula edodes water extracts and Lentinan on proliferation of myosatellite cell of Bos taurus Hanwoo)

  • 김소희;오세혁;박상훈;김은진;최정석;이화용
    • Journal of Applied Biological Chemistry
    • /
    • 제66권
    • /
    • pp.60-66
    • /
    • 2023
  • 표고는 전세계적으로 많이 생산되는 버섯 중 하나이다. 베타글루칸은 근아세포의 증식과 분화를 증가시키며, 골격근의 기능을 향상시키는 것으로 알려져 있다. 본 연구에서는 표고 물 추출물과 표고의 베타글루칸인 렌티난이 한우 근육세포의 증식에 미치는 영향을 알아보고자 하였다. 표고 물 추출물의 베타글루칸의 함량은 85 ℃ 4시간 추출조건에서 약 15.20%, 100 ℃ 4시간 추출조건에서 약 13.64%, 40 ℃ 8시간 추출조건와 상온 24시간 추출조건에서 각각 약 9.48%와 약 8.21%였다. 표고 물 추출물을 한우 근육위성세포의 배양에 첨가하였을 때, MyoD 유전자는 40 ℃ 8시간, 그리고 100 ℃ 4시간 추출물에서 그리고 Myogenin 유전자는 40 ℃ 8시간 추출물에서 발현이 증가하였고, 증식과 활성은 무처리에 비하여 증가하지 않았다. 하지만, 근육위성세포의 배양에 렌티난의 첨가는 한우 근육위성세포의 세포분화와 근육형성에 관련된 Myogenin 유전자의 발현, 세포의 증식과 활성을 증가시켰다. 본 연구는 표고의 성분이 한우근육위성세포의 증식에 영향을 줄 수 있는 것을 확인하였으며, 추가연구를 통하여 차후 버섯 산업 및 배양육 산업의 발전에 도움을 줄 수 있을 것이다.

표 서식 문서의 구조 분석을 위한 선분 에지 기반의 유형별 꼭짓점 검출 (Line Edge-Based Type-Specific Corner Points Extraction for the Analysis of Table Form Document Structure)

  • 정재영
    • 디지털콘텐츠학회 논문지
    • /
    • 제15권2호
    • /
    • pp.209-217
    • /
    • 2014
  • 표 서식을 활용하고 있는 수많은 문서들을 종류에 따라 자동으로 분류하거나, 서식에 기입된 정보를 서식과 분리하여 추출하는 기술은 매우 중요하게 활용된다. 이를 위해서는 표 서식 구조를 정확하게 파악하는 과정은 필수적이다. 본 논문에서는 표 서식 문서 영상에 대한 유형별 꼭짓점 검출 방법을 제안한다. 주요 처리 과정은 전처리, 에지 블록 검출, 선분 에지 블록 검출, 꼭짓점 검출 단계를 거친다. 추출된 꼭짓점들은 선분 에지들이 다양한 형태로 직교하는 교차점들로 9가지 유형으로 분류된다. 실험에서는 제안한 방법을 세금계산서, 거래명세표, 표를 포함하고 있는 일반 문서 등과 같은 몇 가지 형태의 영상에 적용하여 99% 이상의 유형별 꼭짓점 추출 성능 결과를 보인다. 서식 문서 내에서의 대부분의 꼭짓점들은 대칭 형태로 존재한다는 사실을 고려할 때, 꼭짓점의 유형, 선분 에지의 폭 및 그들의 위치 관계를 활용하여 서식의 구조 분석에 활용 가능하다.