Search | Korea Science

ManiFL : A Better Natural-Language-Processing Tool Based On Shallow-Learning (ManiFL : 얕은 학습 기반의 더 나은 자연어처리 도구)

Shin, Joon-Choul;Kim, Wan-Su;Lee, Ju-Sang;Ock, Cheol-Young
- Annual Conference on Human and Language Technology
- /
- 2021.10a
- /
- pp.311-315
- /
- 2021
근래의 자연어처리 분야에서는 잘 만들어진 도구(Library)를 이용하여 생산성 높은 개발과 연구가 활발하게 이뤄지고 있다. 이 중에 대다수는 깊은 학습(Deep-Learning, 딥러닝) 기반인데, 이런 모델들은 학습 속도가 느리고, 비용이 비싸고, 사용(Run-Time) 속도도 느리다. 이뿐만 아니라 라벨(Label)의 가짓수가 굉장히 많거나, 라벨의 구성이 단어마다 달라질 수 있는 의미분별(동형이의어, 다의어 번호 태깅) 분야에서 딥러닝은 굉장히 비효율적인 문제가 있다. 이런 문제들은 오히려 기존의 얕은 학습(Shallow-Learning)기반 모델에서는 없던 것들이지만, 최근의 연구경향에서 딥러닝 비중이 급격히 증가하면서, 멀티스레딩 같은 고급 기능들을 지원하는 얕은 학습 기반 언어모델이 새로이 개발되지 않고 있었다. 본 논문에서는 학습과 태깅 모두에서 멀티스레딩을 지원하고, 딥러닝에서 연구된 드롭아웃 기법이 구현된 자연어처리 도구인 혼합 자질 가변 표지기 ManiFL(Manifold Feature Labelling : ManiFL)을 소개한다. 본 논문은 실험을 통해서 ManiFL로 다의어태깅이 가능함을 보여주고, 딥러닝과 CRFsuite에서 높은 성능을 보여주는 개체명 인식에서도 비교할만한 성능이 나옴을 보였다.
PDF

Ensemble-based Counterfeit Detection Algorithm (앙상블 기반의 위조 탐지 알고리즘)

Ilkin Taghiyev;Youngbok-Cho
- Proceedings of the Korean Society of Computer Information Conference
- /
- 2023.01a
- /
- pp.101-102
- /
- 2023
본 연구에서는 인터넷 상에서 발생되는 부정행위를 탐지할수 있는 신뢰 모델을 생성하고 개인의 프라이버시를 보장할수 있는 모델을 제시하였다. 인터넷 상에 게시판에 올려진 부정해위를 탐지하기 위해 앙상블 접근 방식 기반의 분류 모델을 제시하고 자동화된 도구를 제안하였다. 본 연구는 데이터에 대한 탐색적 데이터 분석을 수행하고 얻은 통찰력을 사용해 자연어처리 가반 텍스트를 기반으로 앙상블 기반의 위조 탐지 알고리즘을 제안하였다. 제안 알고리즘의 정확도는 99%로 자연어 처리에 높은 탐지율을 보였다.
PDF

Natural Language Toolkit _ Korean (NLTKo 1.0: 한국어 언어처리 도구)

Hong, Seong-Tae;Cha, Jeong-Won
- Annual Conference on Human and Language Technology
- /
- 2021.10a
- /
- pp.554-557
- /
- 2021
NLTKo는 한국어 분석 도구들을 NLTK에 결합하여 사용할 수 있게 만든 도구이다. NLTKo는 전처리 도구, 토크나이저, 형태소 분석기, 세종 의미사전, 분류 및 기계번역 성능 평가 도구를 추가로 제공한다. 이들은 기존의 NLTK 함수와 동일한 방법으로 사용할 수 있도록 구현하였다. 또한 세종 의미사전을 제공하여 한국어 동의어/반의어, 상/하위어 등을 제공한다. NLTKo는 한국어 자연어처리를 위한 교육에 도움이 될 것으로 믿는다.
PDF

An Automated Production System Design for Natural Language Processing Models Using Korean Pre-trained Model (한국어 사전학습 모델을 활용한 자연어 처리 모델 자동 산출 시스템 설계)

Jihyoung Jang;Hoyoon Choi;Gun-woo Lee;Myung-seok Choi;Charmgil Hong
- Annual Conference on Human and Language Technology
- /
- 2022.10a
- /
- pp.613-618
- /
- 2022
효과적인 자연어 처리를 위해 제안된 Transformer 구조의 등장 이후, 이를 활용한 대규모 언어 모델이자 사전학습 모델인 BERT, GPT, OPT 등이 공개되었고, 이들을 한국어에 보다 특화한 KoBERT, KoGPT 등의 사전학습 모델이 공개되었다. 자연어 처리 모델의 확보를 위한 학습 자원이 늘어나고 있지만, 사전학습 모델을 각종 응용작업에 적용하기 위해서는 데이터 준비, 코드 작성, 파인 튜닝 및 저장과 같은 복잡한 절차를 수행해야 하며, 이는 다수의 응용 사용자에게 여전히 도전적인 과정으로, 올바른 결과를 도출하는 것은 쉽지 않다. 이러한 어려움을 완화시키고, 다양한 기계 학습 모델을 사용자 데이터에 보다 쉽게 적용할 수 있도록 AutoML으로 통칭되는 자동 하이퍼파라미터 탐색, 모델 구조 탐색 등의 기법이 고안되고 있다. 본 연구에서는 한국어 사전학습 모델과 한국어 텍스트 데이터를 사용한 자연어 처리 모델 산출 과정을 정형화 및 절차화하여, 궁극적으로 목표로 하는 예측 모델을 자동으로 산출하는 시스템의 설계를 소개한다.
PDF

A Korean Corpus Analysis Tool for Language Information Acquisition (언어 정보 획득을 위한 한국어 코퍼스 분석 도구)

Lee, Ho;Kim, Jin-Dong;Rim, Hae-Chang
- Annual Conference on Human and Language Technology
- /
- 1994.11a
- /
- pp.297-304
- /
- 1994
코퍼스는 기계 가독형으로 개장되어 있는 실제 사용 언어의 집합으로 자연어 처리에 필요한 여러 가지 언어 정보를 내재하고 있다. 이들 정보는 코퍼스 분석기를 이용하여 획득할 수 있으며 용례와 각종 통계 정보 및 확률 정보, 연어 목록 등은 코퍼스에서 추출할 수 있는 대표적인 언어 정보들이다. 그러나 기존의 한국어 코퍼스 분석 도구들은 용례 추출 기능만을 보유하여 활용 범위가 제한되어 있었다. 이에 본 논문에서는 대량의 한국어 코퍼스를 분석하여 용례뿐만 아니라 자연어 처리의 제분야에서 필요한 언어 정보들을 추출하는 방법에 대해 연구하였으며 이의 검증을 위해 KCAT(Korean Corpus Analysis Tool)를 구현하였다. KCAT는 코퍼스 색인, 용례 추출, 통계 정보 추출, 연어 추출 부분으로 구성되어 있다. 용례 색인을 위해서는 여러 가지 사전과 용례 색인 구조가 필요한데 KCAT에서는 가변 차수 B-Tree 구조를 이용하여 사전을 구성하며 용례 색인을 위해 버킷 단위의 역 화일 구조를 이용한다. 질 좋은 용례의 추출을 위해 KCAT는 다양한 용례 연산 및 정렬 기능을 제공한다. 또한 통계적 방법의 자연어 처리 분야를 위해 어휘 확률, 상태 전이 확률, 관측 심볼 확률, 상호 정보, T-score 등을 제공하며, 기계 번역 분야에서 필요한 연어를 추출한다.
PDF

KoNLTK: Korean Natural Language Toolkit (KoNLTK: 한국어 언어 처리 도구)

Nam, Gyu-Hyeon;Lee, Hyun-Young;Kang, Seung-Shik
- Annual Conference on Human and Language Technology
- /
- 2018.10a
- /
- pp.611-613
- /
- 2018
KoNLTK는 한국어와 관련된 다양한 언어자원과 언어처리 도구들을 파이썬 플랫폼에서 하나의 인터페이스 환경에서 제공하기 위한 언어처리 플랫폼이다. 형태소 분석기, 개체명 인식기, 의존 구조 파서 등 기초 분석 도구들과 단어 벡터, 감정 분석 등 응용 도구들을 제공하여 한국어 텍스트 분석이 필요한 연구자들의 편의성을 증대시킬 수 있다.
PDF

웹사이트 접근성 자동화 평가 도구의 개선 방안에 관한 연구

홍순구;이대형
- Proceedings of the Korea Association of Information Systems Conference
- /
- 2005.12a
- /
- pp.97-109
- /
- 2005
노인 인구의 급격한 증가와 인터넷을 통한 정보획득의 보편화로 인하여 웹 접근성의 중요성이 부각되고 있다. 웹 접근성이란 "경제적, 지역적, 신체적, 사회적 한계로 인해 정보서비스를 받기 어려운 자들에 대한 정보 통신망의 자유로운 접근과 이용" 을 의미한다 정부기관이 선도하여 웹사이트를 통해 보다 편리하고 좋은 서비스를 국민에게 제공하려는 전세계적인 노력에도 불구하고 장애인이나 노인들에게는 아직도 웹사이트의 접근이 용이하지 못한 실정이다. 이는 웹 접근성의 문제를 발생시키는 근본 원인 중 하나인 웹 접근성(Web Accessibility)에 대한 개념 이해 및 현재 사용되는 웹사이트의 접근성 만족 유무를 정확하게 평가할 수 있는 평가 방법의 부재에 기인한다. 현재까지 웹 접근성 평가는 표준 평가항목인 W3C의 웹 접근성 지침(Web Contents Accessibility Guideline 1.0, 이하 WCAG 1.0)을 기반으로 만들어진 자동화 평가도구를 이용하여 대부분 이루어져 왔다. 자동차 평가도구를 이용한 웹 접근성 평가 방법은 평가가 용이하고 평가결과의 정량화로 인해 연구의 객관성을 높일 수 있다는 장점이 있다. 그러나 선행연구와 실험을 통해 자동화 평가도구의 문제점이 지적되고 있다. 예를 들어 전문가가 직접 스크린 리더를 통해 계산한 접근성 오류와 자동화 도구가 계산한 접근성 오류와는 많은 차이를 보이고 있다. 기존 연구에서는 자동화 평가도구의 문제점을 보완하기 위해 전문가가 직접 평가하는 매뉴얼 평가방식과의 병행을 제시하고 있으나, 근본적인 문제점을 해결하고 이를 개선할 수 있는 연구가 필요하다. 따라서 본 연구에서는 "한국형 웹 콘텐츠 접근성 지침(TTAS.0T-10.0003)"을 기본으로 하여 "EuroAccessibilty Consortium" 에서 고려하고 있는 "testable statement" 으로 통합 보안한 접근성 체크항목의 재구성과 함께 "자연어 처리" 알고리즘을 적용하여 자동화 평가도구의 개선 방안을 제시한다. 아직까지 제시된 개선방안의 적용 및 검증이 이루어지지 않아 한계점을 가지고 있으나 자동화 평가도구의 개선방안에 대한 제안은 향후 연구의 기초자료로 활용 가능할 것이며 많은 후속연구를 유발할 것으로 기대한다.
PDF

A Survey on Deep Learning-based Pre-Trained Language Models (딥러닝 기반 사전학습 언어모델에 대한 이해와 현황)

Sangun Park
- The Journal of Bigdata
- /
- v.7 no.2
- /
- pp.11-29
- /
- 2022
Pre-trained language models are the most important and widely used tools in natural language processing tasks. Since those have been pre-trained for a large amount of corpus, high performance can be expected even with fine-tuning learning using a small number of data. Since the elements necessary for implementation, such as a pre-trained tokenizer and a deep learning model including pre-trained weights, are distributed together, the cost and period of natural language processing has been greatly reduced. Transformer variants are the most representative pre-trained language models that provide these advantages. Those are being actively used in other fields such as computer vision and audio applications. In order to make it easier for researchers to understand the pre-trained language model and apply it to natural language processing tasks, this paper describes the definition of the language model and the pre-learning language model, and discusses the development process of the pre-trained language model and especially representative Transformer variants.
https://doi.org/10.36498/kbigdt.2022.7.2.11 인용 PDF KSCI

English Corpus Construction Tool Based Using Cloud Services (클라우드 서비스를 이용한 영어 말뭉치 구축 도구)

Kim, Sung-Dong;Kim, Minwoo
- Proceedings of the Korea Information Processing Society Conference
- /
- 2019.10a
- /
- pp.1122-1124
- /
- 2019
본 논문에서는 영어 신문 사이트를 크롤링하여 뉴스 기사를 수집하여 영어 말뭉치를 구축하는 도구를 제안한다. 클라우드 서비스를 이용함으로써 장소와 시간에 구애받지 않고 말뭉치를 지속적으로 확장시킬 수 있을 뿐만 아니라 쉽게 구축된 말뭉치를 활용할 수 있다. 제안한 도구는 수집된 영어 신문 기사에 대한 통계 정보 즉, 문장 수, 단어 수 등을 제공한다. 웹 플랫폼에서 동작하므로 여러 명이 동시에 많은 데이터를 수집할 수 있다 수집된 데이터는 자연어 처리 및 기계학습 연구에 활용될 수 있다.
https://doi.org/10.3745/PKIPS.y2019m10a.1122 인용 PDF

A Study on the Hangul Query Processor based on IFM(Information Modeling) (IFM에 기반한 한글 질의 처리기의 설계와 구현)

Lee, Seo-Jeong;Park, Jai-Nyun
- The Transactions of the Korea Information Processing Society
- /
- v.4 no.10
- /
- pp.2445-2452
- /
- 1997
To assist the system development methodologies, there have been a lot of researches for treatment of natural language specification, which represents system behavior and user behavior. In this paper, we suggest Hangul Query Processor based on IFM(InFormation Modeling) which is one of the Object-Oriented software development methods. This Hangul query processor translates the Korean language specification to SQL and response query result. And it is designed to improve system usability by providing convenience to Korean language users. The advantages are The Hangul Query Processor affect higher system usability of and users in that it solves user's Korean language specification without help of the expert. And the software development contained query processor has result to be more participation of users and to reduce the system development time.
PDF

Search Result 48, Processing Time 0.025 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)