• 제목/요약/키워드: Information Enrichment

검색결과 127건 처리시간 0.021초

A Study on a Statistical Matching Method Using Clustering for Data Enrichment

  • Kim Soon Y.;Lee Ki H.;Chung Sung S.
    • Communications for Statistical Applications and Methods
    • /
    • 제12권2호
    • /
    • pp.509-520
    • /
    • 2005
  • Data fusion is defined as the process of combining data and information from different sources for the effectiveness of the usage of useful information contents. In this paper, we propose a data fusion algorithm using k-means clustering method for data enrichment to improve data quality in knowledge discovery in database(KDD) process. An empirical study was conducted to compare the proposed data fusion technique with the existing techniques and shows that the newly proposed clustering data fusion technique has low MSE in continuous fusion variables.

Fisher Criterion을 이용한 Gene Set Enrichment Analysis 기반 유의 유전자 집합의 검출 방법 연구 (Identifying Statistically Significant Gene-Sets by Gene Set Enrichment Analysis Using Fisher Criterion)

  • 김재영;신미영
    • 전자공학회논문지CI
    • /
    • 제45권4호
    • /
    • pp.19-26
    • /
    • 2008
  • Gene set enrichment analysis (GSEA)는 두 개의 클래스를 가지는 마이크로어레이 실험 데이터 분석을 위해 생물학적 특징을 기반으로 구성된 다양한 유전자-집합 중에서 두 클래스의 발현값들이 통계적으로 중요한 차이를 나타내는 유의한 유전자-집합을 추출하기 위한 분석 방법이다. 특히, 유전자에 대한 다양한 생물학적인 정보를 지닌 유전자 주석 데이터베이스(Cytogenetic Band, KEGG pathway, Gene Ontology 등)를 이용하여 마이크로어레이 실험에 사용된 전체 유전자 중 특정 기능을 가지는 유전자들을 그룹화하여 다양한 유전자-집합을 발굴하고, 각 유전자-집합 내에서 두 클래스간에 발현값의 차이를 참조하여 유의한 유전자들을 결정하여, 이를 기반으로 통계적으로 유의한 유전자-집합들을 최종 검출하는 방법이다. 본 논문에서는 GSEA 분석 과정에서 현재 주로 사용되고 있는 signal-to-noise ratio 기반 유전자 서열화(gene ranking) 방법 대신에, Fisher criterion을 이용한 유전자 서열화 방법을 적용함으로써 기존의 GSEA 방법에서 추출하지 못한 생물학적으로 의미 있는 새로운 유의 유전자-집합을 추출하는 방법을 제안하고자 한다. 또한, 제안한 방법의 성능을 고찰하기 위하여 공개된 Leukemia 관련 마이크로어레이 실험 데이터 분석에 적용하였으며, 기존의 알려진 결과와 비교 분석함으로써 제안한 방법의 유용성을 검증하고자 하였다.

온톨로지와 Semantic Enrichment를 이용한 스팸 메일 필터링 시스템 (Spam Mail Filtering System using Ontology and Semantic Enrichment)

  • 김현준;김흥남;정재은;조근식
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 봄 학술발표논문집 Vol.31 No.1 (B)
    • /
    • pp.553-555
    • /
    • 2004
  • 최근 인터넷의 급속한 성장과 더불어 전자메일(I-Mail)은 의사교환의 필수적인 매체로 사용 되어지고 있다. 그러나 편리하고 비용이 들지 앉는 장정을 이용해 엄청난 양의 스맴 메일이 매일같이 솎아져 오고, 이를 해결하기 위한 다양한 연구들이 제시되어져 왔다. 특히. 문서 분류에 널리 쓰이는 베이지안 분류자(Bayesian classifier)가 가장 널리 이용되어지고 있는데, 정확도와 재현율에서 비교적 우수한 성능을 보이고 있다. 그러나 몇 가지 문제점을 갖고 있는데, 첫째, 사전에 사용자에 의해 스팸. 논스팸 메일에 대한 충분한 학습이 선행되어야 하는 정, 둘째, 필터링을 위한 연산시간이 소요되는 점, 셋째, 필터링의 대상이 되는 메일 본문의 내용이 적을 경우 정확한 필터링이 어렵다는 정 등의 문제점이 있다. 본 논문에서는 마지막 문제점으로 지적된 메일 본문의 내용이 적을 경우 즉, 연산을 위한 특징적인 단어들의 부족으로 정확한 분류가 불가능한 경우의 해결방안으로 온틀로지와 Semantic Enrichment 기법을 이용한 스팸 메일 필터링 시스템을 제안한다. 실험 결과, 제안하는 시스템이 베이지안 분류자를 이용한 분류 시스템보다 정확도에서 4.1%, 재현율에서 10.5%. 그리고 F-measure에서 7.64%의 성능향상을 보였다.

  • PDF

Uranium Enrichment Comparison of UO2 Pellet with Alpha Spectrometry and TIMS

  • Song, Ji-Yeon;Seo, Hana;Kim, Sung-Hwan;Choi, Jung-Youn
    • Journal of Radiation Protection and Research
    • /
    • 제43권3호
    • /
    • pp.120-123
    • /
    • 2018
  • Background: Analysis of enrichment of $UO_2$ is important to verify the information declared by the license-holders. The redundancy methods are required to guarantee the analysis result. Korea Institute of Nuclear Nonproliferation and Control (KINAC) used to analyze it with alpha spectrometry and consign to Korea Basic Science Institute (KBSI) Thermal Ionization Mass Spectrometry (TIMS). This article evaluated the similarity of the results with two methods and derive correlation equation. It could be compared to the results measured by TIMS running by KBSI. Materials and Methods: There are not many certified materials for the uranium enrichment value. Therefore, 34 uranium pellets, which have the wide range of uranium enrichment from 0.21 to 4.69 wt%, were used for the experiments by the alpha spectrometry and the TIMS. Results and Discussion: The study shows there are the tendency of analyzed enrichment by each equipment. It shows uranium enrichment with alpha spectrometry evaluated 17% higher than that with TIMS on average. The regression equations were also derived in case the similarity between the two results with two methods is lower than predicted. Two experiments were designed to compare the effect of number of samples. The $R^2$ was 0.9977 with 34 pellets. It shows the equation is appropriate to predict the enrichment values by TIMS with that of alpha spectrometry. The $R^2$ was 0.9858 with four pellets for ten times. The $R^2$ decreased while the number of samples increased. The discrepancy between the lowest and highest enrichment seems to be one of the reason for it. Conclusion: KINAC expects the first equation with 34 samples is useful to predict the result with TIMS, the redundancy method, based on the alpha spectrometry. The extra samples are necessary to collect if the enrichment value analyzed by TIMS is lower than the value predicted with the equation. Further study would be followed related to the impact of the peak counts for each uranium isotopes, sample amount and number of experiments when TIMS established in KINAC by the end of 2018.

자질별 관계 패턴의 다변화를 통한 온톨로지 확장 (Incremental Enrichment of Ontologies through Feature-based Pattern Variations)

  • 이신목;장두성;신지애
    • 정보처리학회논문지B
    • /
    • 제15B권4호
    • /
    • pp.365-374
    • /
    • 2008
  • 본 논문에서는 패턴의 다변화를 통하여 관계를 점진적으로 추출함으로써 온톨로지를 확장하는 모델을 제안한다. 패턴 다변화 과정에서 위키피디아로부터 추출한 관계 패턴 후보를 자질별로 다변화시킨다. 다변화된 패턴 후보로부터 말뭉치 빈도수에 따른 신뢰도를 이용하여 패턴을 선별한다. 선별된 패턴은 위키피디아로부터 관계를 추출하는 데 사용되며, 추출된 관계는 다시 관계 패턴 확장에 사용된다. 본 논문에서는 점진적 학습 과정에서의 패턴 다변화를 통하여 패턴 선택의 범위를 확장함으로써, 선택되는 패턴이 점진적으로 정제되는 모델을 제시한다. 이를 통하여, 관계의 확장성과 정확도를 향상시키고자 하였다. 단일 자질 패턴 모델에 대한 실험을 통하여, 어휘, 중심어, 상위어 정보는 신뢰도에, 품사, 구문 정보는 확장성에 유리하며, 구문 단위 유형별로 필요한 자질 유형이 다름을 관찰하였다. 이와 같은 특성에 기반하여 현재 연구 진행 중인복합 자질 패턴 모델을 제안한다.

GraPT: Genomic InteRpreter about Predictive Toxicology

  • Woo Jung-Hoon;Park Yu-Rang;Jung Yong;Kim Ji-Hun;Kim Ju-Han
    • Genomics & Informatics
    • /
    • 제4권3호
    • /
    • pp.129-132
    • /
    • 2006
  • Toxicogenomics has recently emerged in the field of toxicology and the DNA microarray technique has become common strategy for predictive toxicology which studies molecular mechanism caused by exposure of chemical or environmental stress. Although microarray experiment offers extensive genomic information to the researchers, yet high dimensional characteristic of the data often makes it hard to extract meaningful result. Therefore we developed toxicant enrichment analysis similar to the common enrichment approach. We also developed web-based system graPT to enable considerable prediction of toxic endpoints of experimental chemical.

의사결정 규칙을 이용한 데이터 통합에 관한 연구 (A Study on the Data Fusion Method using Decision Rule for Data Enrichment)

  • 김순영;정성석
    • 응용통계연구
    • /
    • 제19권2호
    • /
    • pp.291-303
    • /
    • 2006
  • 대용량의 데이터로부터 의미있는 지식을 찾는 과정에서 데이터의 질은 무엇보다도 중요하다. 본 연구에서는 데이터의 충실도를 높이기 위한 방법으로 여러 경로로부터 수집된 데이터의 정보를 활용하기 위해 데이터 마이닝 알고리즘인 의사결정 규칙을 이용한 데이터 통합 기법을 제안하고, 실제 데이터를 이용하여 모의실험을 통해 제안된 알고리즘의 효율성을 비교하였다. 실험결과 제안된 알고리즘이 데이터 통합의 성능을 향상시킴을 알 수 있었다.

산소부화조건의 메탄 상세반응기구에 대한 실험 및 수치해석 연구 (Experimental and Numerical Investigations on Detailed Methane Reaction Mechanisms in Oxygen Enriched Conditions)

  • 한지웅;이창언
    • 대한기계학회논문집B
    • /
    • 제28권2호
    • /
    • pp.207-214
    • /
    • 2004
  • The burning velocities of conventional and oxygen-enriched methane flame in various equivalence ratio were determined by experiments. The validity of existing reaction mechanisms was examined in oxygen-enriched flame on the basis of the experiment results. Modified reaction mechanism is suggested, which was able to predict burning velocity of oxygen enriched flame as well as methane-air flame. Complementary study on reaction mechanisms shows the following results : Present experiment data were found to be more reliable in comparison with existing ones in a oxygen-enrichment condition. It was found that some modification in existing reaction mechanisms is necessary, since discrepancy between measurements and predictions is increasing with oxygen enrichment ratio. The sensitivity analysis was performed to discriminate the dominantly affecting reactions on the burning velocity in various oxygen enrichment and equivalence ratio. A modified GRI 3.0 reaction mechanism based on our experiment results was suggested, in which reaction rate coefficients of (R38) H+O$_2$<=>O+OH in GRI 3.0 reaction mechanisms were corrected based on sensitivity analysis results. This mechanism showed a good agreement in predicting the burning velocity and number density of NO in oxygen-enriched flame and would provide proper reaction information of oxygen-enriched flame at this stage.

데이터 보강을 위한 데이터 통합기법에 관한 연구 (A Study on the Data Fusion for Data Enrichment)

  • 정성석;김순영;김현진
    • 응용통계연구
    • /
    • 제17권3호
    • /
    • pp.605-617
    • /
    • 2004
  • 데이터마이닝에서 가장 중요한 요소 중 하나는 마이닝에 사용될 데이터의 질이다. 질 높은 데이터를 바탕으로 마이닝이 수행될 때, 데이터마이닝의 잠재적 가치는 증대될 것이다. 본 논문에서는 지식발견 과정 중 데이터의 질을 향상시키기 위한 한 단계인 데이터 보강을 위해 데이터 통합 기법을 제안하고, 모의실험을 통해 제안된 알고리즘의 효율성을 비교하였다. 실험결과 제안된 알고리즘이 데이터 통합의 성능을 향상시킴을 알 수 있었다.