• 제목/요약/키워드: Data dictionary

검색결과 346건 처리시간 0.025초

실시간 데이터 압축을 위한 Lempel-Ziv 압축기의 효과적인 구조의 제안 (An efficient Hardware Architecture of Lempel-Ziv Compressor for Real Time Data Compression)

  • 진용선;정정화
    • 대한전자공학회논문지TE
    • /
    • 제37권3호
    • /
    • pp.37-44
    • /
    • 2000
  • 본 논문에서는 실시간 데이터 압축을 위한 Lempel-Ziv 압축기의 효과적인 하드웨어 구조를 제안한다. 일반적으로 Lempel-Ziv 알고리즘의 구현에서는 matching 바이트 탐색과 dictionary 버퍼의 누적된 shift 동작이 처리 속도에 가장 중요한 문제이다. 제안하는 구조에서는 dictionary 크기를 최적화하는 방법과 복수개의 바이트를 동시에 비교하는 matching 바이트 처리 방법, 그리고 회전 FIEO 구조를 이용하여 shift 동작 제어 방법을 이용함으로써 효과적인 Lempel-Ziv 알고리즘의 처리 구조를 제안하였다. 제안된 구조는 상용 DSP를 사용하여 하드웨어적으로 정확하게 동작함을 검증하였으며, VHDL로 기술한 후 회로 합성을 수행하여 상용 FPGA 칩에 구현하였다. 제안된 구조는 시스템 클락 33㎒, 비트율 256Kbps 전용선에서 오류 없이 동작함을 확인하였다.

  • PDF

빅데이터 선호도 분석 시스템 설계 (Design of Big Data Preference Analysis System)

  • 손성일;박찬곤
    • 한국멀티미디어학회논문지
    • /
    • 제17권11호
    • /
    • pp.1286-1295
    • /
    • 2014
  • This paper suggests the way that it could improve the reliability about preference of user's feedback by adding weighting factor on sentiment analysis, and efficiently make a sentiment analysis of users' emotional perspective on the big data massively generated on twitter. To solve errors on earlier studies, this paper has improved recall and precision of sensibility determination by using sensibility dictionary subdivided sentiment polarity based on the level of sensibility and given impotance to sensibility determination by populating slang, new words, emoticons and idiomatic expressions not in the system dictionary. It has considered the context through conjunctive adverbs fixed in korean characteristics which are free to the word order. It also recognize sensibility words such as TF(Term Frequency), RT(Retweet), Follower which are weighting factors of preference and has increased reliability of preference analysis considering weight on 'a very emotional tweet', 'a recognised tweet from users' and 'a tweeter influencer'

발음사전 표제어중의 음소의 통계적 성질-음성 DB용 단어선정을 위하여- (On the statistics of Korean Phonetic Dictionary - Basic Survey to make corpus of Korean Speech DB -)

  • 이용주;김경태;조철우;이태원
    • 대한전기학회:학술대회논문집
    • /
    • 대한전기학회 1987년도 전기.전자공학 학술대회 논문집(II)
    • /
    • pp.1606-1609
    • /
    • 1987
  • Statistical information about spoken Korean was obtained. The data are the results of analyzing the Korean phonetic dictionary. This is one of the basic survey to make phoneme ballanced corpus of Korean Speech Data Base (KSDB).

  • PDF

다중언어 RDD 레지스트리의 설계 및 구현 (A Design and Implementation of the Multilingual RDD Registry)

  • 정상원;오원근;윤기송
    • 방송공학회논문지
    • /
    • 제8권4호
    • /
    • pp.381-391
    • /
    • 2003
  • This paper deals nth the Multilingual Registry for the Rights Data Dictionary (RDD), which will be used for the semantic representation of rights on digital contents in MPEG-21 framework. The translation of RDD terms owing to different language populations often lacks the desirable precision. The purpose of this paper Is to demonstrate the Multilingual RDD Registry concept to achieve a more precise and interoperable translation of RDD terms among different DRM systems.

한국고고학 디지털 사전 구축 방안 연구 (Approaches to Creating a Digital Encyclopedia of Korean Archaeology)

  • 이초롱
    • 헤리티지:역사와 과학
    • /
    • 제56권2호
    • /
    • pp.28-45
    • /
    • 2023
  • 디지털 대전환 시대를 맞이했지만 문화유적 조사 결과 생산되는 수많은 고고 디지털 원천 자료를 효율적으로 수집·관리·통합·서비스할 수 있는 활용체계, 즉 고고학술정보의 지능형 통합관리·서비스 플랫폼은 부재한 상황이다. 이와 관련하여, 현재 웹에서 PDF형태로 서비스되고 있는 한국고고학사전의 단순 전산화(Digitization) 문제와 한국고고학사전 발간 및 활용 현황 등을 통해 '한국고고학 디지털 사전 구축' 필요성을 확인하였다. 이에 본 연구에서는 자료 접근의 한계와 어려움에 따른 고고학술 데이터 접근성 제고와 고품질의 지식정보 제공을 중심으로 한 '한국고고학 디지털 사전 구축'의 전반적인 방향을 제안하였다. 2001년부터 발간하고 있는 한국고고학사전의 활용 현황을 분석하여 디지털 전환의 필요성을 확인하였고, 유럽, 미국, 일본 등 국외 고고학 데이터 아카이빙 플랫폼과 국내 전문사전과 관련한 플랫폼 구축 사례를 검토하여 데이터의 체계적인 관리와 보존, 활용에 대해 살펴보았다. 이를 통해 '한국고고학 디지털 사전 구축'을 위한 실행 과제로서 전산화된 기록물에 대한 메타데이터 설계와 생산된 메타데이터 간의 관계 정보를 부여하고 보여주는 시맨틱(semantic, 의미 기반) 데이터로의 확장 등을 제안하였다. 이러한 연구를 바탕으로 향후 고고학술정보의 지능형 통합관리·서비스 플랫폼 구축과 이에 따른 한국고고학에 대한 대중의 관심과 이해를 한 단계 높일 수 있는 발판을 마련하는 계기가 될 것으로 기대한다.

영한 기계번역 시스템의 영한 변환사전 확장 도구 (English-Korean Transfer Dictionary Extension Tool in English-Korean Machine Translation System)

  • 김성동
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제2권1호
    • /
    • pp.35-42
    • /
    • 2013
  • 영한 기계번역 시스템을 개발하기 위해서는 언어에 대한 다양한 정보를 필요로 하며, 특히 영어 단어에 대한 의미 정보를 포함하는 영한 변환사전의 풍부한 정보량은 번역품질에 중요한 요소이다. 지속적으로 생성되는 새로운 단어들은 사전에 등록되어 있지 않아 번역문에 영어 단어가 그대로 출력되어 번역품질을 저하시킨다. 또한 복합명사는 어휘분석, 구문분석을 복잡하게 하고 사전에 의미가 등록되지 않은 경우가 많아 올바르게 번역하기 어렵다. 따라서 영한 기계번역의 번역품질 향상을 위해서는 사전에 등록되어 있지 않은 단어들과 자주 사용되는 복합명사들을 수집하고 의미 정보를 추가하여 영한 변환사전을 지속적으로 확장하는 것이 필요하다. 본 논문에서는 인터넷 신문기사로부터 말뭉치를 추출하고, 사전 미등록 단어와 자주 나타나는 복합명사를 찾은 후, 이들에 대해 의미를 부착하여 영한 변환사전에 추가하는 일련의 과정으로 구성되는 영한 변환사전의 확장 방안을 제안하고 이를 지원하는 도구를 개발하였다. 사전 정보의 확대는 많은 사람의 노력을 필요로 하는 일이지만, 영한 기계번역 시스템의 개선을 위해서는 필수적이다. 본 논문에서 개발한 도구는 사람의 노력을 최소화 하면서, 영한 변환사전의 정보량 지속적인 확대를 위해 유용하게 활용되어 영한 기계번역 시스템의 번역품질 개선에 기여할 것으로 기대된다.

전략 테이블과 유전 알고리즘을 이용한 LZ77 알고리즘의 성능 개선 (Performance Improvement of LZ77 Algorithm using a Strategy Table and a Genetic Algorithm)

  • 정순철;서동일;문병로
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제31권12호
    • /
    • pp.1628-1636
    • /
    • 2004
  • 저장 공간이나 전송 시간을 줄여서 비용을 아끼는 데이타 압축 기술은 그 유용성 때문에 오래전부터 연구되어 왔다. Lempel-Ziv 77(LZ77) 알고리즘은 실용적인 사전-기반 비손실 압축 알고리즘이다. 기존의 LZ77 알고리즘에서 알고리즘의 성능에 큰 영향을 미치는, 사전의 크기는 고정되어 있다. 본 논문에서는 사전의 크기를 동적으로 바꾸면서 압축을 하는 동적 LZ77 알고리즘과 동적 LZ77 알고리즘에서 사용하는 전략을 진화시키는 유전 알고리즘을 소개한다. 유전 알고리즘으로 진화시킨 전략을 가지고 동적 LZ77 알고리즘은 기존의 LZ77 알고리즘보다 최대 약 16%까지 더 좋은 압축 효율을 보여 주었다.

한국어 형태소 분석을 위한 효율적 기분석 사전의 구성 방법 (Construction of an Efficient Pre-analyzed Dictionary for Korean Morphological Analysis)

  • 곽수정;김보겸;이재성
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제2권12호
    • /
    • pp.881-888
    • /
    • 2013
  • 기분석 사전은 형태소 분석기의 속도와 정확도를 향상시키고, 과분석을 줄이기 위해 사용된다. 하지만 기분석 사전에 저장된 어절 중에 저장된 형태소 분석 결과가 부족한 어절, 즉 불충분 분석 어절이 존재할 경우 오히려 형태소 분석기의 정확도를 떨어뜨리는 원인으로 작용할 수 있다. 본 논문에서는 세종 형태 분석 말뭉치(문어체, 2011)를 이용해 말뭉치의 크기와 어절 빈도의 변화에 따라 사전의 정답 제시율이 변화하는 양상을 측정하였다. 그리고 통계기반의 형태소 분석기인 SMA와 기분석 사전을 결합한 통합 시스템을 구성하여 기분석 사전의 충분 분석률이 99.82% 이상일 때 시스템 전체 성능이 향상되는 것을 확인하였다. 또한 160만 어절의 말뭉치를 이용할 때는 32회 이상 출현한 어절로, 630만 어절로 구성된 말뭉치를 이용할 때는 64회 이상 출현한 어절로 사전을 구성하는 것이 통합 시스템의 성능을 가장 높게 할 수 있었다.

RSA 일방향 어큐뮬레이터를 이용한 효율적이고 동적인 인증 딕셔너리 설계 (Efficient and Dynamic Authenticated Dictionary Design Using RSA One-way Accumulator)

  • 김순석;이용희;이강우
    • 한국정보통신학회논문지
    • /
    • 제12권4호
    • /
    • pp.651-660
    • /
    • 2008
  • 현재 인터넷과 같이 널리 사용되는 공개된 네트워크를 통해 법률적으로 유효한 문서나 상거래 계약서와 같은 엄격한 보안이 요구되는 기밀정보가 교환되고 있으며, 이와 동시에 이러한 기밀정보의 교환에 있어서 정보의 무결성과 인증을 위해 공개키 인증서가 사용되고 있다. 그러나 현 공개키 기반구조 환경에서는 공개키 인증서의 유효성을 확인하는데 있어서 전송용량 면이나 안전성면에서 여러 가지 문제점들을 내포하고 있다. 본 논문은 RSA 일방향 어큐뮬레이터를 사용하여 믿을 수 있는 정보제공자에 의해 유지되는 집합에 대한 사용자의 멤버쉽 질의에 대해 공모 가능한 디렉토리가 암호학적으로 검증된 응답을 제공하는 효율적이고 동적인 인증된 딕셔너리를 실현하였다.

텍스트마이닝을 이용한 사회 이슈 찬반 분류에 관한 연구 (Study on the social issue sentiment classification using text mining)

  • 강선아;김유신;최상현
    • Journal of the Korean Data and Information Science Society
    • /
    • 제26권5호
    • /
    • pp.1167-1173
    • /
    • 2015
  • 정보통신기술의 발전은 SNS, 블로그, 게시판 등 자신의 생각이나 의견을 표출할 수 있는 장소의 다양성을 제공하였고 이는 빅데이터 성장을 가능케 하였다. 특히 매순간마다 엄청난 수의 사용자가 이용가능하고 다양한 이슈에 대한 의견을 작성할 수 있는 SNS의 특징으로 인해 많은 사람들이 트위터 등에 사회적 이슈에 대한 자신의 의견을 드러낸다. 따라서 본 연구에서는 트위터에서 작성되는 사회 이슈에 대한 의견을 수집하여 사회이슈를 주제로 하는 감성사전을 구축하고 구축된 감성사전을 통해 감성 분석을 실시하고자 한다. 사용된 데이터는 '비키니', '나꼼수'를 포함하는 트윗 글이다. 사회이슈에 특화된 주제지향 감성사전을 구축하고 구축된 감성사전을 통해 긍부정 의견을 분석한 결과 Precision은 61%로 나타났으며 F1-score는 74%의 성능을 보여주었다. 본 연구는 정치적 색을 띄고 있는 특정 사회 이슈에 대한 트윗 작성자의 의견이 긍정인지 부정인지 자동으로 분류할 수 있도록 하는 사전 구축의 하나의 기준을 제시할 것이라 기대한다.