• 제목/요약/키워드: Text corpus

검색결과 243건 처리시간 0.024초

지자체 사이버 공간 안전을 위한 금융사기 탐지 텍스트 마이닝 방법 (Financial Fraud Detection using Text Mining Analysis against Municipal Cybercriminality)

  • 최석재;이중원;권오병
    • 지능정보연구
    • /
    • 제23권3호
    • /
    • pp.119-138
    • /
    • 2017
  • 최근 SNS는 개인의 의사소통뿐 아니라 마케팅의 중요한 채널로도 자리매김하고 있다. 그러나 사이버 범죄 역시 정보와 통신 기술의 발달에 따라 진화하여 불법 광고가 SNS에 다량으로 배포되고 있다. 그 결과 개인정보를 빼앗기거나 금전적인 손해가 빈번하게 일어난다. 본 연구에서는 SNS로 전달되는 홍보글인 비정형 데이터를 분석하여 어떤 글이 금융사기(예: 불법 대부업 및 불법 방문판매)와 관련된 글인지를 분석하는 방법론을 제안하였다. 불법 홍보글 학습 데이터를 만드는 과정과, 데이터의 특성을 고려하여 입력 데이터를 구성하는 방안, 그리고 판별 알고리즘의 선택과 추출할 정보 대상의 선정 등이 프레임워크의 주요 구성 요소이다. 본 연구의 방법은 실제로 모 지방자치단체의 금융사기 방지 프로그램의 파일럿 테스트에 활용되었으며, 실제 데이터를 가지고 분석한 결과 금융사기 글을 판정하는 정확도가 사람들에 의하여 판정하는 것이나 키워드 추출법(Term Frequency), MLE 등에 비하여 월등함을 검증하였다.

SMS 변형된 문자열의 자동 오류 교정 시스템 (Automatic Error Correction System for Erroneous SMS Strings)

  • 강승식;장두성
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제35권6호
    • /
    • pp.386-391
    • /
    • 2008
  • 휴대폰과 메신저 등 통신 환경에서 문자 메시지를 전송할 때 표준어가 아닌 왜곡된 어휘들을 사용하고 있으며, 이러한 변형된 어휘들은 음성 인식, 음성 합성, 문서 정보 추출 등 언어처리 및 관련 분야의 응용 시스템에서 많은 문제점을 유발시킨다. 본 논문에서는SMS 문장들의 변형 및 띄어쓰기 오류를 자동으로 교정하여 형태소 분석 및 품사 태깅의 성능 저하 문제를 방지하는 문자열 오류의 교정 방법을 제안하고 시스템을 구현하였다. 시스템의 성능에 가장 큰 영향을 미치는 변형된 문자열 사전을 구축하는 방법으로 (1) 통신 어휘집을 기반으로 수동으로 구축하는 방법, (2) 수작업으로 구축된 말뭉치로부터 자동으로 변형된 문자열을 추출하는 방법, (3) 자동으로 변형된 문자열을 추출할 때 좌우 문맥을 고려하는 방법에 대하여 시스템을 구현하고 실험을 통하여 비교-분석 및 성능 평가 결과를 제시하였다.

평면적 어휘 자질들을 활용한 확장 혼합 커널 기반 관계 추출 (Relation Extraction based on Extended Composite Kernel using Flat Lexical Features)

  • 최성필;정창후;최윤수;맹성현
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제36권8호
    • /
    • pp.642-652
    • /
    • 2009
  • 본 논문에서는 기존의 관계 추출 성능을 향상시키기 위해서 기존의 자질 기반 방법에서 추구하였던 개체 주변 문맥 다양성 정보의 추출 및 적용과 커널 기반 방법의 강점인 관계 인스턴스에 대한 구문 구조적 자질 정보의 통합 활용을 통한 확장된 혼합 커널을 제안한다. ACE RDC 코퍼스를 활용한 실험에서, 기존의 합성곱 구문 트리 커널 기반 혼합 커널을 기반으로 총 9 종류의 평면적 어휘 자질 집합을 정의하고 이를 적용함으로써 성능 향상에 기여하는 어휘 자질 유형을 파악할 수 있었으며, 적은 규모의 학습 집합으로도 현재 최고 수준의 성능에 필적하는 결과를 얻을 수 있었다. 결론적으로 관계 추출을 위한 세 가지 핵심 정보, 즉 개체 자질, 구문 구조적 자질, 주변 문맥 어휘 자질을 통합 적용하면 관계 추출의 성능을 향상시킬 수 있음을 알 수 있었다.

Ethanol 에 의해 발기부전을 유도한 흰쥐의 성기능 개선에 미치는 합환피(合歡皮)의 영향 (Effects of Albizzia Julibrissin on Chronic Ethanol-treated Erectile Dysfunction in Rats)

  • 이민동;정지천
    • 대한한의학회지
    • /
    • 제27권2호
    • /
    • pp.232-243
    • /
    • 2006
  • Objectives : Albizzia Julibrissin was formulated to contain various natural products known to cure erectile dysfunction. This study was aimed to investigate the effects of Albizzia Julibrissin on the nitric oxide synthase (NOS) activity, nitrite level, antioxidation and erectile responses induced by ethanol in corpus cavernosum penis of rats. Methods : The crushed Albizzia Julibrissin was extracted 3 times, each time with 3 volumes of methyl alcohol at $60^{\circ}C$ for 24 h. The extract was filtered and evaporated under a reduced pressure using a rotary evaporator to yield 45.3 g. Albizzia Julibrissin extract was oral-administered 100 mg per 1 kg of body weight for 20 days, while the normal group was administered only with a saline. The efficacy of Albizzia Julibrissin against erectile function was examined as described in the text. Results : The level of urethral NOS activity and nitrite were increased by Albizzia Julibrissin. The level of lipid peroxide was decreased by Albizzia Julibrissin. The level of urethral lipid peroxide in the ethanol-Albizzia Julibrissin double administered rats was decreased as low as in the norma! group, while the one in the ethanol-treated group was increased. The level of urethral nitrite, NOS activity, glutathione and serum testosterone in the ethanol-Albizzia Julibrissin double administered rats were as high as in the normal group, while the one in the ethanol-treated group was decreased. The erectile response to cavernous nerve stimulation in the ethanol-Albizzia Julibrissin double administered rats increased as high as in the normal group while the one in the ethanol-treated group decreased. Conclusions : Albizzia Julibrissin was shown to be effective for the treatment of erectile dysfunction induced by ethanol in rats.

  • PDF

다목적 유전자 알고리즘을 이용한문서 클러스터링 (The Document Clustering using Multi-Objective Genetic Algorithms)

  • 이정송;박순철
    • 한국산업정보학회논문지
    • /
    • 제17권2호
    • /
    • pp.57-64
    • /
    • 2012
  • 본 논문에서는 텍스트 마이닝 분야에서 중요한 부분을 차지하고 있는 문서 클러스터링을 위하여 다목적 유전자 알고리즘을 제안한다. 문서 클러스터링에 있어 중요한 요소 중 하나는 유사한 문서를 그룹화 하는 클러스터링 알고리즘이다. 지금까지 문서 클러스터링에는 k-means 클러스터링, 유전자 알고리즘 등을 사용한 연구가 많이 진행되고 있다. 하지만 k-means 클러스터링은 초기 클러스터 중심에 따라 성능 차이가 크며 유전자 알고리즘은 목적함수에 따라 지역 최적해에 쉽게 빠지는 단점을 갖고 있다. 본 논문에서는 이러한 단점을 보완하기 위하여 다목적 유전자 알고리즘을 문서 클러스터링에 적용해 보고, 기존의 알고리즘과 정확성을 비교 및 분석한다. 성능 시험을 통해 k-means 클러스터링(약 20%)과 기존의 유전자 알고리즘(약 17%)을 비교할 때 본 논문에서 제안한 다목적 유전자 알고리즘의 성능이 월등하게 향상됨을 보인다.

모바일 환경을 고려한 규칙기반 음성인식 오류교정 (Rule-based Speech Recognition Error Correction for Mobile Environment)

  • 김진형;박소영
    • 한국컴퓨터정보학회논문지
    • /
    • 제17권10호
    • /
    • pp.25-33
    • /
    • 2012
  • 본 논문에서는 모바일 환경에서 음성인식한 결과에 포함된 오류를 교정하는 규칙기반 접근방법을 제안한다. 제안하는 방법은 처리시간이나 메모리에 제약을 받는 모바일 환경을 고려하여 다음과 같이 구성된다. 오류 교정 속도를 최소화하기 위해서, 음절 해체 및 조합 과정이나 형태소 분석 등의 처리를 줄이고, 최장일치 규칙 선택기준을 바탕으로 오류 발생 추정 지점에서 교정 후보도 하나만 생성한다. 제안하는 방법은 메모리를 효율적으로 사용하기 위해서, 어절사전이나 형태소분석기를 사용하지 않고, 규칙도 유형별로 따로 구분하지 않고 통합하여 저장한다. 제안하는 방법은 모델의 수정 및 유지보수가 용이하도록, 오류교정규칙을 학습말뭉치에서 자동으로 추출하여 구축한다. 실험결과 제안하는 방법은 음성인식 결과에 대하여 정확률을 5.27% 정도 재현율을 5.60% 정도 개선하였다.

동시출현 자질과 집단 지성을 이용한 지식검색 문서 사용자 명성 평가 (User Reputation Evaluation Using Co-occurrence Feature and Collective Intelligence)

  • 이현우;한요섭;김래현;차정원
    • 인지과학
    • /
    • 제19권4호
    • /
    • pp.459-476
    • /
    • 2008
  • 많은 사용자들의 참여로 구축된 집단 지성을 이용한 지식 검색 서비스에서 사용자가 원하는 답변을 빨리 찾고자 하는 요구가 증가하고 있다. 기존의 연구에서 조회 수, 추천 수, 답변 수와 같은 비텍스트 정보가 답변을 평가하는데 좋은 자질임이 증명되었고, 신뢰도를 추정할 수 있는 여러 종류의 단어 사전을 이용하여 답변의 좋고 나쁨을 평가할 수 있는 연구도 진행되었다. 하지만, 조회 수, 추천 수, 답변 수와 같은 비텍스트 정보는 사용자 조작이 간단하여 지속적으로 관리를 해야 하며, 신뢰도를 추정할 수 있는 단어는 지속적으로 보강되어야 한다. 본 논문에서는 이러한 문제점을 해결하고자 동시출현 자질을 이용한 질문과 답변의 유사성을 활용하여 집단 지성에서 사용자의 활동을 분석하여 사용자의 명성을 평가하는 방법을 제안한다. 사용자의 명성을 계산할 수 있다면 조회 수와 추천 수가 많지 않은 답변의 신뢰도도 비교적 정확하게 추정할 수 있다. 이를 위해 우리는 PageRank 알고리즘을 수정하여 사용자 명성을 계산한다. 네이버 지식iN의 문서로 실험한 결과, 기존 정답 선택률을 보완할 수 있는 결과를 보였다.

  • PDF

CosmoScriBe 2.0: 한국어 전사 도구의 개발 (CosmoScriBe 2.0 : The development of Korean transcription tools)

  • 곽선동;장문수
    • 한국지능시스템학회논문지
    • /
    • 제24권3호
    • /
    • pp.323-329
    • /
    • 2014
  • 구어 연구에서는 음성 데이터를 문자로 옮기는 전사(Transcription)라는 과정이 필요하다. 전사 작업을 보조하는 프로그램을 전사도구라고 하는데, 발화 내용을 비롯하여, 발화 시간, 화자 정보 등의 많은 정보를 기록하는 다양한 기능을 제공한다. 이로 인하여 컴퓨터 사용에 익숙하지 않은 사용자는 숙지하는데 어려움이 있다. 또한 전사 도구는 국내에서 개발된 것이 거의 없어서 한국어 환경에 적합하지 않는 경우가 많다. 본 논문에서는 효율적인 한국어 전사를 지원하면서 비숙련자도 도구를 쉽고 빠르게 적응할 수 있는 전사 도구를 제안한다. 이를 위해 비숙련자를 위한 사용자 친화적인 인터페이스 환경을 제공한다. 또한 전사 과정에서 발생할 수 있는 실수를 최소화하기 위해 전사 지원 기능을 제공한다. 마지막으로 데이터 신뢰성을 위한 시스템 구조를 제공한다. 제안하는 도구에 대해 전사 경험의 유무에 따라 사용성 평가를 하였으며, 평가결과는 전체적으로 전사 속도 향상 및 전사 지원 기능이 편리한 것으로 나타났다.

인터넷 감정기호를 이용한 긍정/부정 말뭉치 구축 및 감정분류 자동화 (Automatic Construction of a Negative/positive Corpus and Emotional Classification using the Internet Emotional Sign)

  • 장경애;박상현;김우제
    • 정보과학회 논문지
    • /
    • 제42권4호
    • /
    • pp.512-521
    • /
    • 2015
  • 네티즌은 인터넷을 통해서 상품을 구매하고 상품에 대한 감정을 긍정 혹은 부정으로 상품평에 표현한다. 상품평에 대한 분석은 잠재적 소비자뿐만 아니라 기업의 의사결정에 중요한 자료가 된다. 따라서 인터넷의 대량 리뷰에서 의미 있는 정보를 분석하여 의견을 도출하는 오피니언 마이닝 기술의 중요성이 증대되고 있다. 기존의 연구는 대부분이 영어를 기반으로 진행되었고 아직 한글에 대한 상품평 분석은 활발히 이루어 지지 않고 있다. 또한 한글은 영어와 달라 꾸미는 말과 어미가 복잡한 특성을 갖고 있다. 그리고 기존의 연구는 통계적 기법, 사전 기법, 기계학습 기법 등을 사용하여 연구되었으나 인터넷 언어의 특성을 감안하지는 못하였다. 본 연구에서는 감정이 포함된 인터넷 언어의 특성을 분석하여 감정분석의 정확률을 높이는 감정분류 방법을 제안한다. 이를 통해 데이터에 독립적인 인터넷 감정기호를 이용해서 자동으로 긍정 및 부정 상품평을 분류할 수 있었고 높은 정확률, 재현율, Coverage 결과를 통해서 제안 알고리즘의 유효성을 확인할 수 있었다.

한국어 극성 사전 구축을 위한 크라우드소싱 기반 감성 단어 극성 태깅 게임 (A Crowdsourcing-based Emotional Words Tagging Game for Building a Polarity Lexicon in Korean)

  • 김준기;강신진;배병철
    • 한국게임학회 논문지
    • /
    • 제17권2호
    • /
    • pp.135-144
    • /
    • 2017
  • 감성 분석은 글을 통해 작성자의 주관적인 생각이나 느낌을 분석하는 방법으로 효과적인 감성 분석을 위해서는 감성 단어 극성 사전 구축이 필수적이다. 본 논문은 효율적인 한국어 극성 사전 구축을 위해 우리가 개발한 크라우드소싱 기반 게임을 소개한다. 먼저, 크롤러를 이용해 인터넷 커뮤니티에서 말뭉치들을 수집했고, Twitter 형태소를 이용해 수집한 말뭉치를 형태소별로 분류하고 단어화했다. 이 단어들은 모바일 플랫폼 기반 태깅 게임 형태로 제공되어 게임플레이를 통해 플레이어들이 자발적으로 단어들의 극성을 선택하고 결과가 데이터 베이스에 축적되도록 게임이 설계되었다. 현재까지 약 1200여개의 단어들의 극성을 태깅하였으며, 향후 좀 더 많은 감성 단어 데이터들을 축적함으로써 특히 게임 도메인에서 한국어 감성 분석 연구에 기여할 것으로 기대한다.