• Title/Summary/Keyword: 대용량자료

Search Result 369, Processing Time 0.026 seconds

A divide-oversampling and conquer algorithm based support vector machine for massive and highly imbalanced data (불균형의 대용량 범주형 자료에 대한 분할-과대추출 정복 서포트 벡터 머신)

  • Bang, Sungwan;Kim, Jaeoh
    • The Korean Journal of Applied Statistics
    • /
    • v.35 no.2
    • /
    • pp.177-188
    • /
    • 2022
  • The support vector machine (SVM) has been successfully applied to various classification areas with a high level of classification accuracy. However, it is infeasible to use the SVM in analyzing massive data because of its significant computational problems. When analyzing imbalanced data with different class sizes, furthermore, the classification accuracy of SVM in minority class may drop significantly because its classifier could be biased toward the majority class. To overcome such a problem, we propose the DOC-SVM method, which uses divide-oversampling and conquers techniques. The proposed DOC-SVM divides the majority class into a few subsets and applies an oversampling technique to the minority class in order to produce the balanced subsets. And then the DOC-SVM obtains the final classifier by aggregating all SVM classifiers obtained from the balanced subsets. Simulation studies are presented to demonstrate the satisfactory performance of the proposed method.

Applications of Cluster Analysis in Biplots (행렬도에서 군집분석의 활용)

  • Choi, Yong-Seok;Kim, Hyoung-Young
    • Communications for Statistical Applications and Methods
    • /
    • v.15 no.1
    • /
    • pp.65-76
    • /
    • 2008
  • Biplots are the multivariate analogue of scatter plots. They approximate the multivariate distribution of a sample in a few dimensions, typically two, and they superimpose on this display representations of the variables on which the samples are measured(Gower and Hand, 1996, Chapter 1). And the relationships between the observations and variables can be easily seen. Thus, biplots are useful for giving a graphical description of the data. However, this method does not give some concise interpretations between variables and observations when the number of observations are large. Therefore, in this study, we will suggest to interpret the biplot analysis by applying the K-means clustering analysis. It shows that the relationships between the clusters and variables can be easily interpreted. So, this method is more useful for giving a graphical description of the data than using raw data.

한국증권시장(韓國證券市場)에서 대용시장(代用市場)포트폴리오효율성(效率性)의 GMM에 의한 다변량(多變量) 검증(檢證)

  • Gu, Bon-Yeol
    • The Korean Journal of Financial Management
    • /
    • v.15 no.1
    • /
    • pp.1-30
    • /
    • 1998
  • 본(本) 연구(硏究)는 한국증권시장에서 대표적 대용시장(代用市場)포트폴리오인 한국종합주가지수(韓國綜合株價指數)와 동일가중지수(同一加重指數)의 효율성에 대한 검증을 Hansen(1982)의 다변량의 GMM에 의하여 실시하고자 하였다. 이를 위하여 먼저, 주식수익률자료(株式收益率資料)에 근거한 산업별(産業別)포트폴리오수익률과 초과시장수익률모형(超過市場收益率模型)의 오차항(誤差項)이 정규분포(正規分布)를 벗어남을 증명함으로써 GMM검증방법(檢證方法)의 정당성을 찾고자 하였다. 정규분포에 대한 검증방법(檢證方法)으로서 왜도와 첨도의 검증과 이를 결합한 Jarque-Bera(1980)검증(檢證)을 실시하였다. 둘째로, Hansen(1982)의 GMM을 대용시장(代用市場)포트폴리오의 효율성(效率性) 검증(檢證)에 적용하는 방법에 대한 연구들인 Mackinlay-Richardson(1991), Harvey-Zhou(1993)와 Campbell-Lo-Mackilay(1997) 등을 기초로하여 이들의 방법론을 개선한 3가지의 효율성(效率性) 검증방법(檢證方法)을 제시하였다. 셋째로, 이상의 검증방법(檢證方法)들을 토대로 1980년 1월부터 1997년 6월까지 월별주식수익률(月別株式收益率)의 자료(資料)를 11업종으로 분류하여 산업별(産業別)포트폴리오수익률(收益率)과 초과시장수익률모형(超過市場收益率模型)에 의한 오차항(誤差項)이 정규분포(正規分布)를 따르는지와 아울러 대용시장(代用市場)포트폴리오의 효율성을 검증하였다. 검증결과(檢證結果), 산업별(産業別)포트폴리오수익률과 오차항(誤差項)은 대부분 정규성이 기각(棄却)되어 GMM검증방법(檢證方法)의 정당성이 입증되었다. 따라서 GMM에 의한 효율성(效率性)을 검증한 결과, 한국종합주가지수(韓國綜合株價指數)의 경우에는 평균-분산(平均-分散)프론티어(mean-variance frontier)상(上)에서의 대용시장(代用市場)포트폴리오의 효율성(效率性)은 기각(棄却) 할 수 없는 것으로 나타났으나 평균수익률(平均收益率)이 GMVP의 수익률보다 낮았기 때문에 효율적(效率的) 프론티어(efficient frontier)상(上)의 대용시장(代用市場)포트폴리오의 효율성(效率性)은 기각(棄却)되어 대용시장지수로서의 문제점이 있는 것으로 나타났다. 그러나 동일가중지수(同一加重指數)는 평균수익률이 GMVP의 수익률보다 높을 뿐만아니라 효율적(效率的) 프론티어상(上)의 대용시장(代用市場)포트폴리오의 효율성(效率性)도 채택되어 한국종합주가지수(韓國綜合株價指數)보다 우월한 지수(指數)인 것으로 나타났다.

  • PDF

Study on Massive Mobile Mapping Data Management Systems using Exif Tags and Data Synchronizations (Exif 태그 및 자료 동기화를 이용한 대용량 모바일 매핑 자료 관리체계 연구)

  • Woo, Hee-Sook;Kwon, Kwang-Seok;Ahn, Ki-Seok
    • Spatial Information Research
    • /
    • v.17 no.1
    • /
    • pp.67-77
    • /
    • 2009
  • Mobile mapping systems with CCD cameras, GPS and IMU etc. can acquire massive photos and geographic informations along by roads. But it is easy to involve many errors or omissions of images and informations about roads and facilities with various files. And there were contained any conflicts or non-consistencies in massive mobile mapping data which were acquired by multiple survey teams in various survey regions. As an image tag standard, Exif helps us to encapsulate the precise GPS times and essential informations in the header of JPEG files and uses with the identification code for consistent managements of massive mobile mapping data in this paper. And Systematic management systems with data synchronization technology manage more consistently massive photos and their information.

  • PDF

Information Retrieval System for Very Large Multimedia Docuement (대용량 멀티미디어 문서를 위한 정보검색 시스템)

  • 진두석;최윤수;안성수
    • Proceedings of the Korea Multimedia Society Conference
    • /
    • 2002.11b
    • /
    • pp.190-193
    • /
    • 2002
  • 인터넷의 급속한 보급과 함께 멀티미디어 문서의 사용에 대한 사용자의 요구가 증가하고 이에 따라 멀티미디어 문서 정보 검색에 관련된 연구들이 국내외적으로 활발하게 진행되고 있다. 멀티미디어 문서는, 데이터의 양이 방대할 뿐 아니라 데이터가 비정형화되어 있기 때문에 분석이 복잡하며 또한 효율적으로 저장, 검색하기가 매우 어렵다. 그러므로 이를 위해서는 적절한 멀티미디어 자료 저장 구조를 지닌 정보 검색 시스템이 절실히 요구된다. 따라서 본 논문에서는 대용량 멀티미디어 문서에 적합한 저장 구조를 가진 정보검색 시스템을 제안한다.

  • PDF

Approximate k-Nearest Neighbor Search Algorithms for Content-Based Retrieval of Multimedia Data (대용량 멀티미디어 데이터의 내용-기반 검색을 위한 근사 k-최근접 데이터 탐색 알고리즘)

  • 송광택;심춘보;장재우
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 1998.10b
    • /
    • pp.256-258
    • /
    • 1998
  • 대용량의 멀티미디어 자료를 기반으로 하는 내용-기반 멀티미디어 검색 시스템에서 k-최근접 탐색 질의는 사용자의 매우 중요한 검색 질의 중에 하나이다. 하지만, 방대한 양의 멀티미디어 데이터베이스를 기반으로하는 경우에는 적중 에러 없는 정확(exact) k-최근접 데이터 탐색을 위해서 상당히 많은 디스크 접근 횟수가 요구된다. 본 논문에서는 X-트리에서의 정확 k-최근접 탐색 질의를 개선하고, 또한 사용자의 빠른 검색 성능을 위해 다소의 적중 에러는 허용한다 하더라도 디스크 접근 횟수를 줄이는 근사(approximate) k-최근접 탐색 알고리즘을 제안한다.

Technology for Searching Massive XML Data with Different Schema (대용량 이종 XML 데이터 검색을 위한 RDBMS기반 인덱싱 기법)

  • 이성진;박영순
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2004.04b
    • /
    • pp.202-204
    • /
    • 2004
  • 최근 XML은 기업간 데이터 교환의 표준으로 자리잡았다. 기업간 데이터 교환은 필연적으로 대량의 XML형태의 데이터가 로그 형태로 보전되게 된다. W3C에서는 XML자료의 검색을 위하여 XQueryl.0을 발표하고 XML 검색문의 표준화를 제시하였다. 검색운과는 별도로 XML데이터의 저장 모델에 대한 연구 또한 활발히 진행되고 있다. 본 논문에서는 대용량 XML데이터를 RDBMS를 이용하여 저장하고 빠른 검색을 지원 할 수 있는 역 인덱싱 방안을 기초로 검색 성능을 향상시킬 수 있는 방안에 대하여 연구하고 기존 방법과의 비교 실험을 통해 그 효과를 검증하였다.

  • PDF

A Method to Provide Context from Massive Data Processing in Context-Aware System (상황인지 시스템에서 대용량의 데이터 처리결과를 컨텍스트 정보로 제공하기 위한 방법)

  • Park, Yoo Sang;Choi, Jong Sun;Choi, Jae Young
    • KIPS Transactions on Software and Data Engineering
    • /
    • v.8 no.4
    • /
    • pp.145-152
    • /
    • 2019
  • Unlike a single value from a sensor device, a massive data set has characteristics for various processing aspects; input data may be formed in a different format, the size of input data varies, and the processing time of analyzing input data is not predictable. Therefore, context aware systems may contain complex modules, and these modules can be implemented and used in different ways. In order to solve these problems, we propose a method to handle context information from the result of analyzing massive data. The proposed method considers analysis work as a different type of abstracting context and suggests the way of representing context information. In experiment, we demonstrate how the context processing engine works properly in a couple of steps with healthcare services.

Implementation of Quality Evaluation, Error Filtering, Imputation for Traffic Missing Data (교통 데이터에 대한 품질 평가 및 자료 처리 기법의 구현)

  • Cheong, Su-Jeong;Song, Soo-Kyung;Lee, Min-Soo;NamGung, Sung
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2007.10c
    • /
    • pp.185-190
    • /
    • 2007
  • 대용량의 자료가 생산됨에 따라 데이터를 효율적으로 저장, 관리, 이용할 수 있는 데이터 웨어하우스의 역할이 중요하게 되었고, 그에 따라 자료 처리 기법의 개발은 필수 과제가 되었다. 품질 평가와 오류 판단, 결측 보정의 자료 처리 과점은 자료의 신뢰도를 판단하고 활용도를 높일 수 있는 과정으로 매우 중요하다. 본 논문에서는 우리나라의 실제 교통상황을 반영하고 평가 기준의 오차를 줄이면서 더욱 간단 명료한 평가 계산식을 도입하여 효율적인 품질평가와 오류판단, 결측 보정의 자료 처리 기법을 제안한다. 또한 오류 판단 기준에 새로운 파라미터론 도입하여 교통 연구자의 요구 사항을 반영할 수 있게 하였다. 결측 보정 과정은 여러 기법을 연구하고 기존의 결측 보정 기법에 입력 변수를 추가하여 실제 대용량의 교통 자료에 적용하였다. 그리고 교통 자료가 저장되는 데이터베이스에 직접 접근하여 결측 보정과정을 수행하도록 PL/SQL로 구현하였으며, 이를 통해 교통 연구자에게 쉽고 다양한 방법으로 결측 보정을 수행하고 그 결과를 이용하여 다양한 교통 정보를 가공할 수 있는 환경을 제공하였다.

  • PDF

Experiment of Searching Candidate Text Pair for Searching Similar Texts among Massive Document Repository (대용량 문서 집합에서 유사문서 탐색을 위한 후보 문서 쌍 검색 실험)

  • Park, Sun-Young;Chung, Woo-Keun;Cho, Hwan-Gue
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2010.06c
    • /
    • pp.275-278
    • /
    • 2010
  • 문서 표절과 관련된 이슈가 급증함에 따라 유사 문서 탐색과 관련한 연구가 활발히 진행되고 있다. 특히 인터넷의 발달로 인해 일반 사용자가 수많은 전자 문서에 쉽게 접근할 수 있게 됨에 따라 대용량 문서 집합에 대한 탐색 속도와 정확성의 중요성도 커지고 있다. 대용량 문서 집합 내에서 빠른 시간 내에 유사 문서를 탐색하는 방법에는 전역 사전을 이용하여 후보 문서 쌍(유사할 가능성이 높은 문서의 쌍)를 추출한 후 찾아낸 후보 문서 쌍에만 정밀한 검사를 수행함으로써 검사 시간을 줄이는 방법이 존재한다. 이 때, 후보 문서를 찾아내기 위하여 전역 사전(Global DICtionary, GDIC)이라는 자료 구조를 이용하게 되는데, 이 전역 사전을 효과적으로 사용하면 후보 문서 쌍을 찾아내는 시간을 기존보다 더욱 줄일 수 있다. 본 논문에서는 전역 사전을 더욱 효과적으로 활용하여 후보 문서 쌍 검색 시간을 대폭 줄이는 방법에 대해 기술하며, 어느 정도의 성능 향상이 있는지 실험을 통해 측정하였다. 20,000건의 실험용 말뭉치 자료와 6263건의 실존하는 보고 문서에 대해 실험한 결과, GDIC 생성에서 2.5~4,6%, 후보 문서 쌍 탐색에서 1%~15.4% 정도의 성능이 향상된 것을 확인할 수 있었다. 추후 update query를 최소화하여 GDIC 생성시간을 추가로 줄이는 방법에 대해 연구할 계획이다.

  • PDF