• 제목/요약/키워드: Large Data Set

검색결과 1,054건 처리시간 0.028초

범주형 데이터에 대한 스카이라인 질의 알고리즘 (Skyline Query Algorithm in the Categoric Data)

  • 이우기;최중호;송종수
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제16권7호
    • /
    • pp.819-823
    • /
    • 2010
  • 스카이라인 질의는 다차원, 대량의 데이터 검색에서 효율적인 방법이다. '지배한다'의 개념을 활용하여 약 95%이상으로 알려진 불필요한 데이터 집합을 검색 대상에서 제외하고 필요한 데이터에 집중하게 만들기 때문이다. 지금까지의 스카이라인 질의 알고리즘들은 데이터 집합이 모두 수치형 데이터일 경우에만 한정하여 개발되었다. 따라서 데이터베이스 등에 저장된 대부분의 텍스트 데이터들은 기존 스카이라인 질의 알고리즘을 사용하여 결과를 얻을 수 없었다. 본 연구는 스카이라인 질의의 대상을 범주형 데이터라는 전혀 새로운 영역을 개척한 점에서 의미가 있다. 우선 범주형 데이터 거리를 2종류를 개발하고 이를 스카이라인 질의에 적용하였고, 실험에서는 ACM의 실제 논문데이터를 사용하여 처리시간 및 정확도 비율 등에서 그 효과성을 입증하였다.

러프집합을 통한 취업의사결정 분석시스템 (Decision Analysis System for Job Guidance using Rough Set)

  • 이희태;박인규
    • 디지털융복합연구
    • /
    • 제11권10호
    • /
    • pp.387-394
    • /
    • 2013
  • 데이터 마이닝은 예측이나 분석을 위해서 많은 양의 데이터에 존재하는 여러 가지의 관계를 추출하는 과정이라고 할 수 있다. 그러한 데이터에는 매우 많은 변수로 인한 차원의 증가로 인하여 계산상의 어려움이 수반되어지고 변수의 중복성과 중요도에 있어서 다양한 통계적 관계가 존재한다. 따라서 동일하거나 유사한 데이터를 같은 그룹으로 형성하는 클러스터 해석은 데이터 마이닝에서 필수적인 요소이다. 본 연구는 범주형 데이터의 분류에서 발생하는 불확실성의 처리를 위해 러프집합을 이용하여 정보 엔트로피를 이용한 새로운 척도를 정의하고 연구 대상에 대한 유사행동을 분석하는 시스템 구현에 그 의의가 있다. 데이터는 평택공업고등학교에서 채집되었고 이를 토대로 제안된 방법이 학생들의 유사행동에 대한 보다 정확한 결과를 보임을 알 수 있었다. 또한 속성의 개수가 10개 이상인 경우에 기본 방법과의 차이를 보이며 취업의사결정에서 학생들의 의식을 기존 방법보다 효과적으로 반영하였다.

빅데이터 K-평균 클러스터링을 위한 RHadoop 플랫폼 (RHadoop platform for K-Means clustering of big data)

  • 신지은;오윤식;임동훈
    • Journal of the Korean Data and Information Science Society
    • /
    • 제27권3호
    • /
    • pp.609-619
    • /
    • 2016
  • 본 논문에서는 대용량 데이터를 처리 및 분석하기 위해 RHadoop 플랫폼에서 실제 데이터와 모의 실험 데이터를 가지고 K-평균 클러스터링을 구현하고, MapReduce의 컴바이너 사용여부에 따른 처리 속도를 비교하고자 한다. 또한, K-평균 클러스터링에서 최적의 군집수 결정방법을 MapReduce 프로그램으로 구현하여 실제 데이터에 적용하고자 한다. 그리고 제안된 RHadoop 플랫폼의 확장 가능성을 보이기 위해 실제 데이터에서 R의 기본 패키지에서 kmeans() 함수와 bigmemory 패키지 상에서 유용한 bigkmeans() 함수와 처리 속도를 비교하고자 한다.

Pulsar Polar Cap and Slot Gap Models: Confronting Fermi Data

  • Harding, Alice K.
    • Journal of Astronomy and Space Sciences
    • /
    • 제30권3호
    • /
    • pp.145-152
    • /
    • 2013
  • Rotation-powered pulsars are excellent laboratories for studying particle acceleration as well as fundamental physics of strong gravity, strong magnetic fields and relativity. Particle acceleration and high-energy emission from the polar caps is expected to occur in connection with electron-positron pair cascades. I will review acceleration and gamma-ray emission from the pulsar polar cap and associated slot gap. Predictions of these models can be tested with the data set on pulsars collected by the Large Area Telescope on the Fermi Gamma-Ray Telescope over the last four years, using both detailed light curve fitting, population synthesis and phase-resolved spectroscopy.

유전자 알고리즘을 이용한 비모수 회귀분석 (Nonparametric Regression with Genetic Algorithm)

  • 김병도;노상규
    • Asia pacific journal of information systems
    • /
    • 제11권1호
    • /
    • pp.61-73
    • /
    • 2001
  • Predicting a variable using other variables in a large data set is a very difficult task. It involves selecting variables to include in a model and determining the shape of the relationship between variables. Nonparametric regression such as smoothing splines and neural networks are widely-used methods for such a task. We propose an alternative method based on a genetic algorithm(GA) to solve this problem. We applied GA to regression splines, a nonparametric regression method, to estimate functional forms between variables. Using several simulated and real data, our technique is shown to outperform traditional nonparametric methods such as smoothing splines and neural networks.

  • PDF

An Efficient Video Retrieval Algorithm Using Luminance Projection

  • Kim, Sang-Hyun
    • Journal of the Korean Data and Information Science Society
    • /
    • 제15권4호
    • /
    • pp.891-898
    • /
    • 2004
  • An effective video indexing is required to manipulate large video databases. Most algorithms for video indexing have been commonly used histograms, edges, or motion features. In this paper, we propose an efficient algorithm using the luminance projection for video retrieval. To effectively index the video sequences and to reduce the computational complexity, we use the key frames extracted by the cumulative measure, and compare the set of key frames using the modified Hausdorff distance. Experimental results show that the proposed video indexing and video retrieval algorithm yields the higher accuracy and performance than the conventional algorithm.

  • PDF

대용량 폴리곤 데이터 편집을 위한 자료구조 (A Data Structure for Editing Very Large Polygon Data Set)

  • 권대현;김해동;오광만
    • 한국멀티미디어학회:학술대회논문집
    • /
    • 한국멀티미디어학회 2000년도 추계학술발표논문집
    • /
    • pp.467-470
    • /
    • 2000
  • 이 논문에서는 대용량 3 차원 데이터를 효율적 편집과 실시간 랜더링하는 방법라 자료구조를 제안한다. 3 차원 스캐닝 데이터로부터 만들어지는 대용량 폴리곤 데이터를 사용자 인터페이스를 이용하여 실시간에 편집하기 위한 효율적인 자료·구조를 제안하고, 이를 이용한 포리곤 연산자의 구현 방법 설명하고 있다. 또한, 여기서 제안한 자료구조가 기존 edge 기반 자료구조와의 성능비교를 통해 대용량 메쉬 데이터 편집시스템에 적합한 자료구조임을 보이겠다.

  • PDF

미계측 유역의 장기 물수지 분석에 관한 연구 (A Long-Term Water Budget Analysis for an Ungaged River Baisn)

  • 유금환;김태균;윤용남
    • 대한토목학회논문집
    • /
    • 제11권4호
    • /
    • pp.113-119
    • /
    • 1991
  • 본 연구에서는 월 강우량과 월 증발량 자료만 있는 하천유역에 대하여 장기 물수지 분석을 실시하는 방법론을 제시하고져 하였다. 단기간의 월 강우량 자료를 경혐공식에 의해 월 유출량 자료로 변환시킨 후 추계학적 모의발생 모형을 사용하여 이들 단기 유출자료로부터 일군의 장기 유출자료계열을 발생시켰고, 자료계열별로 갈수빈도해석에 의해 최대 갈수기간 및 월 강수량계열을 작성하였다. 계획년도별 각종 용수수요를 표준절차에 의해 추정하였으며 순 물소모량도 계산하였다. 유역내의 기존 저수지를 총괄하는 합성저수지를 통해 Deficit-Supply 방법으로 물 수지분석을 실시한 결과 물 부족량은 갈수재현기간이 커짐에 따라 급격하게 커지는 것으로 나타났다. 이는 하천 유역의 장기 물 수지분석을 통해 신뢰성있는 물 부족량을 계산하기 위해서는 추계학적 모의발생모형에 의한 장기간 유출량의 발생이 필수적이며 수자원 시스템의 적정 갈수재현기간의 선정이 대단히 중요함을 시사해 주는 것이다.

  • PDF

데이터마이닝에서 기존의 연관규칙을 갱신하는 분할 알고리즘 (Partition Algorithm for Updating Discovered Association Rules in Data Mining)

  • 이종섭;황종원;강맹규
    • 산업경영시스템학회지
    • /
    • 제23권54호
    • /
    • pp.1-11
    • /
    • 2000
  • This study suggests the partition algorithm for updating the discovered association rules in large database, because a database may allow frequent or occasional updates, and such update may not only invalidate some existing strong association rules, but also turn some weak rules into strong ones. the Partition algorithm updates strong association rules efficiently in the whole update database reuseing the information of the old large itemsets. Partition algorithms that is suggested in this study scans an incremental database in view of the fact that it is difficult to find the new set of large itemset in the whole updated database after an incremental database is added to the original database. This method of generating large itemsets is different from that of FUP(Fast Update) and KDP(Kim Dong Pil)

  • PDF

Validation of RELAP5 MOD3.3 code for Hybrid-SIT against SET and IET experimental data

  • Yoon, Ho Joon;Al Naqbi, Waleed;Al-Yahia, Omar S.;Jo, Daeseong
    • Nuclear Engineering and Technology
    • /
    • 제52권9호
    • /
    • pp.1926-1938
    • /
    • 2020
  • We validated the performance of RELAP MOD3.3 code regarding the hybrid SIT with available experimental data. The concept of the hybrid SIT is to connect the pressurizer to SIT to utilize the water inside SIT in the case of SBO or SB-LOCA combined with TLOFW. We investigated how well RELAP5 code predicts the physical phenomena in terms of the equilibrium time, stratification, condensation against Separate Effect Test (SET) data. We also conducted the validation of RELAP5 code against Integrated Effect Test (IET) experimental data produced by the ATLAS facility. We followed conventional approach for code validation of IET data, which are pre-test and post-test calculation. RELAP5 code shows substantial difference with changing number of nodes. The increase of the number of nodes tends to reduce the condensation rate at the interface between liquid and vapor inside the hybrid SIT. The environmental heat loss also contributes to the large discrepancy between the simulation results of RELAP5 and the experimental data.