• 제목/요약/키워드: text annotation

검색결과 75건 처리시간 0.02초

디지털 콘텐트의 어노테이션에 관한 연구 (A Study on the Annotation of Digital Content)

  • 곽승진
    • 한국문헌정보학회지
    • /
    • 제40권4호
    • /
    • pp.267-286
    • /
    • 2006
  • 정보폭발 현상이 나타나는 디지털 환경에서 보다 효율적인 정보접근과 선택을 위한 도구가 필요하며, 이러한 도구를 구축하는 진보된 기술 중의 하나가 메타데이터(metadata)와 어노테이션(annotation)이다. 어노테이션은 원본문서와 문서의 특별한 부분에 부가적인 설명과 강조를 위한 표시나 어구를 추가로 기록하는 것으로 메타데이터보다 더 디지털 콘텐트의 효율적인 검색과 이용을 위한 여러 가지 장점을 갖고 있다. 본 연구의 목적은 최근 디지털 환경에서 정보 접근과 재사용, 공유 등 다양한 장점을 갖고 있는 어노테이션을 월 서비스와 디지털도서관. 전자책 등의 디지털 콘텐트에 적용하는 방안을 제시하는 것이다. 연구방법으로 웹 서비스와 디지털도서관에 적용된 어노테이션 시스템 사례를 조사하고, 어노테이션의 메타데이터 유형을 분석하였다.

OryzaGP: rice gene and protein dataset for named-entity recognition

  • Larmande, Pierre;Do, Huy;Wang, Yue
    • Genomics & Informatics
    • /
    • 제17권2호
    • /
    • pp.17.1-17.3
    • /
    • 2019
  • Text mining has become an important research method in biology, with its original purpose to extract biological entities, such as genes, proteins and phenotypic traits, to extend knowledge from scientific papers. However, few thorough studies on text mining and application development, for plant molecular biology data, have been performed, especially for rice, resulting in a lack of datasets available to solve named-entity recognition tasks for this species. Since there are rare benchmarks available for rice, we faced various difficulties in exploiting advanced machine learning methods for accurate analysis of the rice literature. To evaluate several approaches to automatically extract information from gene/protein entities, we built a new dataset for rice as a benchmark. This dataset is composed of a set of titles and abstracts, extracted from scientific papers focusing on the rice species, and is downloaded from PubMed. During the 5th Biomedical Linked Annotation Hackathon, a portion of the dataset was uploaded to PubAnnotation for sharing. Our ultimate goal is to offer a shared task of rice gene/protein name recognition through the BioNLP Open Shared Tasks framework using the dataset, to facilitate an open comparison and evaluation of different approaches to the task.

COVID-19 recommender system based on an annotated multilingual corpus

  • Barros, Marcia;Ruas, Pedro;Sousa, Diana;Bangash, Ali Haider;Couto, Francisco M.
    • Genomics & Informatics
    • /
    • 제19권3호
    • /
    • pp.24.1-24.7
    • /
    • 2021
  • Tracking the most recent advances in Coronavirus disease 2019 (COVID-19)-related research is essential, given the disease's novelty and its impact on society. However, with the publication pace speeding up, researchers and clinicians require automatic approaches to keep up with the incoming information regarding this disease. A solution to this problem requires the development of text mining pipelines; the efficiency of which strongly depends on the availability of curated corpora. However, there is a lack of COVID-19-related corpora, even more, if considering other languages besides English. This project's main contribution was the annotation of a multilingual parallel corpus and the generation of a recommendation dataset (EN-PT and EN-ES) regarding relevant entities, their relations, and recommendation, providing this resource to the community to improve the text mining research on COVID-19-related literature. This work was developed during the 7th Biomedical Linked Annotation Hackathon (BLAH7).

Deep-Learning Approach for Text Detection Using Fully Convolutional Networks

  • Tung, Trieu Son;Lee, Gueesang
    • International Journal of Contents
    • /
    • 제14권1호
    • /
    • pp.1-6
    • /
    • 2018
  • Text, as one of the most influential inventions of humanity, has played an important role in human life since ancient times. The rich and precise information embodied in text is very useful in a wide range of vision-based applications such as the text data extracted from images that can provide information for automatic annotation, indexing, language translation, and the assistance systems for impaired persons. Therefore, natural-scene text detection with active research topics regarding computer vision and document analysis is very important. Previous methods have poor performances due to numerous false-positive and true-negative regions. In this paper, a fully-convolutional-network (FCN)-based method that uses supervised architecture is used to localize textual regions. The model was trained directly using images wherein pixel values were used as inputs and binary ground truth was used as label. The method was evaluated using ICDAR-2013 dataset and proved to be comparable to other feature-based methods. It could expedite research on text detection using deep-learning based approach in the future.

임베디드 RDBMS로의 효율적인 XML 문서 저장 방법 (Efficient XML Document Storage Model to Embedded RDBMS)

  • 조국래;임태형;강원석
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2007년도 가을 학술발표논문집 Vol.34 No.2 (C)
    • /
    • pp.66-71
    • /
    • 2007
  • 멀티미디어 데이터에 대한 효율적인 검색을 지원하기 위해 제정된 MPEG7이나 TV-AnyTime 등의 표준들은 XML을 사용하여 Metadata를 효과적으로 표현할 수 방법을 제시하고 있다. 플랫폼에 독립적으로 사용가능하다는 XML의 강점에도 불구하고 Text 방식으로 데이터를 저장하기 때문에 보안에 취약할 수밖에 없으며, 대용량의 자료 처리에도 문제점을 드러낸다. 이를 보완하기 위하여 XML 문서를 RDBMS에 저장하는 방법들이 제안되고 있는데, 기존의 Model Mapping이나 Structure Mapping의 경우 노드 검색을 위해 Traversing을 할 경우 많은 조인이 필요하기 때문에 한정된 메모리와 낮은 처리능력을 갖춘 임베디드 멀티미디어 플랫폼에서는 비효율적일 수밖에 없다. 본 논문에서는 MPEG7 Metadata를 RDBMS에 저장하고, 이를 검색할 때, 조인의 횟수를 최소화할 수 있는 저장 모델을 제안하고 있다. 부모, 자식, 형제간의 노드를 효율적으로 검색할 수 있도록 path MetaSchema를 제안함으로써, 최소 1번의 검색으로 필요한 노드 정보들을 추출할 수 있도록 하였다. 그리고 Annotation 작성시에 XML의 Attribute와 Element로 삽입하였기에, 기존의 방법에서 Annotation을 분석하기 위해 필요했던 Annotation 파싱을 제거하고, SAX나 DOM을 사용할 수 있도록 제안함으로써, Annotation의 정보에 대한 접근이 효율적으로 개선되었다.

  • PDF

Opinion: Strategy of Semi-Automatically Annotating a Full-Text Corpus of Genomics & Informatics

  • Park, Hyun-Seok
    • Genomics & Informatics
    • /
    • 제16권4호
    • /
    • pp.40.1-40.3
    • /
    • 2018
  • There is a communal need for an annotated corpus consisting of the full texts of biomedical journal articles. In response to community needs, a prototype version of the full-text corpus of Genomics & Informatics, called GNI version 1.0, has recently been published, with 499 annotated full-text articles available as a corpus resource. However, GNI needs to be updated, as the texts were shallow-parsed and annotated with several existing parsers. I list issues associated with upgrading annotations and give an opinion on the methodology for developing the next version of the GNI corpus, based on a semi-automatic strategy for more linguistically rich corpus annotation.

STEP Rally

  • 유상봉
    • 한국전자거래학회:학술대회논문집
    • /
    • 한국전자거래학회 2000년도 종합학술대회발표논문집
    • /
    • pp.151-163
    • /
    • 2000
  • ㆍ 참여 시스템 증가/STEP기능 홍보 ㆍ 일부 파일에서 error 발생 (특히, Surface) ㆍ 한글 지원 안됨 ㆍ 기술표준원, STEP 센터 등에서의 Authority를 갖는 테스트 필요 -국제 및 국내 인증 역할 병행 ㆍ 테스트 항목 상세화 필요 - color, 3D text annotation, drawing view, features - 변환 후 area, volume, centroid 등 확인

  • PDF

모바일 디바이스 화면의 클릭 가능한 객체 탐지를 위한 싱글 샷 디텍터 (Single Shot Detector for Detecting Clickable Object in Mobile Device Screen)

  • 조민석;전혜원;한성수;정창성
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제11권1호
    • /
    • pp.29-34
    • /
    • 2022
  • 모바일 디바이스 화면상의 클릭 가능한 객체를 인지하기 위한 데이터셋을 구축하고 새로운 네트워크 구조를 제안한다. 모바일 디바이스 화면에서 클릭 가능한 객체를 기준으로 다양한 해상도를 가진 디바이스에서 여러 애플리케이션을 대상으로 데이터를 수집하였다. 총 24,937개의 annotation data를 text, edit text, image, button, region, status bar, navigation bar의 7개 카테고리로 세분화하였다. 해당 데이터셋을 학습하기 위한 모델 구조는 Deconvolution Single Shot Detector를 베이스라인으로, backbone network는 기존 ResNet에 Squeeze-and-Excitation block을 추가한 Squeeze-and-Excitation networks를 사용하고, Single shot detector layers와 Deconvolution module을 Feature pyramid networks 형태로 쌓아 올려 header와 연결한다. 또한, 기존 input resolution의 1:1 비율에서 오는 특징의 손실을 최소화하기 위해 모바일 디바이스 화면과 유사한 1:2 비율로 변경하였다. 해당 모델을 구축한 데이터셋에 대하여 실험한 결과 베이스라인에 대비하여 mean average precision이 최대 101% 개선되었다.

멀티-큐 통합을 기반으로 WWW 영상의 자동 주석 (A WWW Images Automatic Annotation Based On Multi-cues Integration)

  • 신성윤;문형윤;이양원
    • 한국컴퓨터정보학회논문지
    • /
    • 제13권4호
    • /
    • pp.79-86
    • /
    • 2008
  • 인터넷의 빠른 발전으로 현재 HTML 웹 페이지에 내장된 영상들은 눈에 띄게 두드러졌다. 내용을 묘사하고 주의를 끄는 놀랄만한 함수 때문에 영상들은 웹 페이지에서 사실상 중요하게 되었다. 모든 영상들은 가공할 만한 데이터베이스로 구성되어있다. 게다가. 영상들의 의미론적인 의미도 주변의 텍스트나 링크에 의해 잘 표현된다. 하지만 이들 영상의 소수들이 주요 구에 정확히 할당되고 주요 구들을 현재의 영상에 수작업으로 할당하는 것은 매우 어렵다. 따라서 주요 구들을 추출하는 절차의 자동화는 매우 바람직하다. 본 논문에서는 먼저 저수준 특징, 페이지 태그, 전체적인 단어 빈도수와 지역적 단어 빈도수를 기반으로 한 WWW 영상 주석 방법을 소개한다. 그리고 멀티-큐 통합영상 주석 방법을 전개해 나간다. 또한 실험을 통하여 멀티-큐 영상 주석 방법이 다른 방법보다 우수함을 보여준다.

  • PDF

『속몽구분주(續蒙求分註)』의 분주(分註) 방식 시고(試考) (A Study on the way of annotation in 『Sok-Mong-Gu Bun-Ju』(續蒙求分註))

  • 이연순
    • 동양고전연구
    • /
    • 제48호
    • /
    • pp.147-167
    • /
    • 2012
  • 본고는 미암 유희춘이 유배지에서 저술한 "속몽구분주(續蒙求分註)"에 대해 "몽구(蒙求)"와 차이를 가지는 분주(分註) 방식을 시험적으로 고찰하여 그 학술서로서 성격을 규명하고자 하였다. 이에 먼저 "속몽구분주"와 "몽구"의 본문 구성에 차이가 있는 점을 들어, "몽구"가 각 편마다 인용출처를 제시하고 인물 일화 중심으로 본문을 구성하였다면, "속몽구분주"는 인용출처를 맨 앞에 한꺼번에 제시하고 본문에서 일화 소개와 함께 분주의 방식을 취하였음을 밝혔다. 이어서 "속몽구분주"의 분주 방식을 자세히 살펴, "속몽구분주"가 네 가지의 분주법(分註法), 곧 소유이궁원(?流而窮源), 분원이지류(汾源而至流), 누사이일의(累事而一意), 이동이호발(異同而互發)에 따라 분주한 방식에 대해 각기 해당하는 예를 들며 살펴보았다. 이로써 "속몽구분주"가 경사자집(經史子集)의 여러 서책을 출처로 하였으되, 특히 주자의 평과 그 당대 학맥에 속하는 인물들의 언급을 많이 참고하였음을 확인할 수 있었다. 그리하여 "속몽구분주"가 주자학에 철저한 학술서이자 유서(類書)로서 학자들이 이용하기에 편리하게 이루어진 저술임을 밝혔다.