• 제목/요약/키워드: 결정나무

검색결과 792건 처리시간 0.037초

연속형 반응변수를 위한 데이터마이닝 방법 성능 향상 연구 (A study for improving data mining methods for continuous response variables)

  • 최진수;이석형;조형준
    • Journal of the Korean Data and Information Science Society
    • /
    • 제21권5호
    • /
    • pp.917-926
    • /
    • 2010
  • 배깅과 부스팅의 기법은 예측력을 향상 시킨다고 알려져 있다. 이는 비교 실험을 통하여 성능이 검증 되었는데, 목표변수가 범주형인 경우에 특정 의사결정나무 알고리즘인 회귀분류나무만 주로 고려되었다. 본 논문에서는 의사결정나무 외에도 다른 데이터마이닝 방법도 고려하여 목표변수가 연속형인 경우에 배깅과 부스팅 기법의 성능 검증을 위한 비교 실험을 실시하였다. 구체적으로, 데이터마이닝 알고리즘 기법인 선형회귀, 의사결정나무, 신경망에 배깅 및 부스팅 앙상블 기법을 결합하여 8개의 데이터를 비교 분석하였다. 실험 결과로 연속형 자료에 대한 여러 데이터마이닝 알고리즘에도 배깅과 부스팅의 기법이 성능 향상에 도움이 되는 것으로 확인되었다.

전라북도 장안산 삼림식생의 종다양성 (Species Diversity of Forest Vegetation in Mt.Jangan, Chollabuk-do)

  • 김창환;명현;신병철
    • 한국환경생태학회지
    • /
    • 제13권3호
    • /
    • pp.271-279
    • /
    • 1999
  • 전라북도 장안산의 72군락 지점에서 식물사회학적 조사에 의하여 구분된 10개 군락. 즉 신갈나무 군락, 신갈나무-철쭉꽃 군락, 신갈나무-노린재나무 군락, 신갈나무-졸참나무 군락, 졸참나무 군락, 굴참나무 군락, 서어나무 군락, 물푸레나무 군락, 층층나무 군락, 들메나무 군락에서 풍부도지수, 이질성지수, 균등도지수, 우점도지수를 산출하여 고도, 토양 특성 및 우점종군에 따른 종다양성의 변활르 분석하였으며 종서열-중요치 곡선을 이용하여 각 식물의 우점서열을 결정하고 각 종이 식물군락 내의 자원을 어떻게 분배하고 있는가를 결정하였다 고도, 토양요인(pH, base) 및 우점종의 차이는 삼림의 종 다양성에 영향을 미치는 중요한 변수로서 작용하였으며 우점종군에 따른 다양성의 변화는 지형과 교란에 의하여 영향을 받았다 종서열-중요치 곡선에서 조사된 10개 군락은 대수정규분포에 접근하고 있어서 군락간 약간의 차이는 있지만 대체적으로 어떤 특정 종이 군집 내 자원 공간을 독점하지 않고 적절히 분배하여 사용하고 있었다.

  • PDF

다중외적연관성규칙을 이용한 불필요한 입력변수 제거에 관한 연구 (A study on removal of unnecessary input variables using multiple external association rule)

  • 조광현;박희창
    • Journal of the Korean Data and Information Science Society
    • /
    • 제22권5호
    • /
    • pp.877-884
    • /
    • 2011
  • 의사결정나무는 데이터마이닝의 대표적인 알고리즘으로서, 의사결정 규칙을 도표화하여 관심대상이 되는 집단을 몇 개의 소집단으로 분류하거나 예측을 수행하는 방법이다. 일반적으로 의사결정나무의 모형 생성 시, 입력 변수의 수가 많을 경우 생성된 의사결정모형은 복잡한 형태가 될 수 있고, 모형 탐색 및 분석에 있어 어려움을 겪기도 한다. 이때 입력변수들 간의 내재적인 관련성은 없으나, 외적 변수에 의하여 각 변수가 우연히 어떤 다른 변수와 연결됨으로써 관련성이 있는 것으로 나타나는 것을 종종 볼 수 있다. 이에 본 논문에서는 의사결정나무 생성 시, 입력 변수에 대한 외적 관계를 파악할 수 있는 다중외적연관성규칙을 이용하여 의사결정나무 생성에 불필요한 입력변수를 제거하는 방법을 제시하고 그 효율성을 파악하기 위하여 실제 자료에 적용하고자 한다.

가래나무로부터 세포독성물질의 분리, 구조결정.

  • 조윤기;손종근;문동철;이인자
    • 한국응용약물학회:학술대회논문집
    • /
    • 한국응용약물학회 1994년도 춘계학술대회 and 제3회 신약개발 연구발표회
    • /
    • pp.248-248
    • /
    • 1994
  • 목적 : 가래나무는 일부 민간방과 한방에서 암 치료의 목적으로 사용되고 있다. 아울러 이 식물을 대상으로 세포독성물질의 분리, 구조결정에 관한 연구는 이미 보고되어 있는 성분인 juglone이 새포독성을 나타낸다는 단편적인 보고만 있을뿐 전혀 되어있지 않은 상태이다. 본 연구는 국내에서 자생하는 가래나무 (Juglans mandchurica)로부터 세포독성물질을 분리, 구조결정함으로서 새로운 항암제 개발에 일차적인 자료를 제공하는 것을 그 목적으로 한다. 방법 : 가래나무 뿌리의 methanol 추출물을 hexane, chloroform, ethyl acetate. n-buthanol, water로 분획하고 세포독성을 측정하였으며, 이들중 ethyl acetate 분획으로부터 세포독성을 나타내는 물질들을 분리하였으며 현재 이들의 구조를 분광분석학적인 방법으로 결정하고 있다. 결과 : 현재까지 분리된 물질들은 약한 세포독성을 나타내고있으며, 그들 중 한물질의 구조를 결정하였다.

  • PDF

산업용 CR영상의 기하학적 데이터 분석과 의사결정나무에 의한 측정 패턴인식 (Measuring Pattern Recognition from Decision Tree and Geometric Data Analysis of Industrial CR Images)

  • 황중원;황재호
    • 전자공학회논문지CI
    • /
    • 제45권5호
    • /
    • pp.56-62
    • /
    • 2008
  • 의사결정나무를 구성하여 강판튜브 비파괴평가에 사용하는 산업용 CR영상의 측정 패턴인식을 도모한다. 본래 비파괴평가는 기계학습기법에 의한 패턴식별과 그 분류에 적합한 분야이다. 의사결정나무의 속성들은 비파괴평가 테스트 절차로부터 취한다. 방사선조사 입사각, 경사도 및 거리 둥의 기하학적 특성들은 입력 영상 데이터 분석으로부터 추정한다. 이 요소들은 대상 입력을 의사결정나무에서 미리 정해진 분류에로 정확히 그리고 쉽게 분류가 이루어지도록 한다. 이 알고리즘은 비파괴평가 결과의 특성화를 간단히 하며 특성 결정을 간편하게 한다. 실험 결과는 제안한 알고리즘의 유용성을 보였다.

S-QUEST와 태아발육제한증 (IUGR) 조기진단시스템 개발

  • 차경준;박문일;최항석;신영재
    • 한국통계학회:학술대회논문집
    • /
    • 한국통계학회 2003년도 춘계 학술발표회 논문집
    • /
    • pp.171-176
    • /
    • 2003
  • 방대한 양의 데이터에서 의사결정에 필요한 정보를 발견하는 일련의 과정을 데이터 마이닝 (data mining)이라고 하는데, 본 연구에서는 생물정보학 (bioinofmatics)의 한분야로서 의학분야의 통계적 의사결정 시스템을 제공하는 의사결정나무 (decision tree) 알고리즘 중 QUEST를 S-PLUS로 구현하고(이하 S-QUEST) 발육제한(Intrauterine Growth Restriction; IUGR) 데이터를 분석하였다.

  • PDF

의사결정나무를 이용한 개인휴대통신 해지자 분석

  • 최종후;서두성
    • 한국경영과학회:학술대회논문집
    • /
    • 한국경영과학회 1998년도 추계학술대회 논문집
    • /
    • pp.377-380
    • /
    • 1998
  • 본 논문에서는 최근 데이터마이닝의 도구로 활발하게 소개되고 있는 의사결정나무 분석을 이용하여 개인휴대통신의 해지자 분석을 실시한다. 또한 로지스틱 회귀모형을 이용하여 가입고객의 해지 가능성에 대한 점수화를 시도한다.

  • PDF

로지스틱 회귀분석과 의사결정나무 분석을 이용한 일 대도시 주민의 우울 예측요인 비교 연구 (Comparative Analysis of Predictors of Depression for Residents in a Metropolitan City using Logistic Regression and Decision Making Tree)

  • 김수진;김보영
    • 한국콘텐츠학회논문지
    • /
    • 제13권12호
    • /
    • pp.829-839
    • /
    • 2013
  • 본 연구는 로지스틱 회귀분석과 의사결정나무 분석을 활용하여 일 대도시 주민의 우울에 영향을 주는 요인을 예측하고 비교하고자 시도된 서술적 조사연구이다. 연구대상은 20세에서 65세 미만의 일 대도시 주민 462명이었다. 자료 수집은 2011년 10월 7일부터 10월 21일까지이었으며, 자료 분석은 SPSS 18.0 프로그램을 이용하여 빈도, 백분율, 평균과 표준편차 및 ${\chi}^2$-test, t-test, 로지스틱 회귀분석, roc curve, 의사결정나무 분석으로 분석하였다. 본 연구 결과, 로지스틱 회귀분석과 의사결정나무 분석에서 공통적으로 나타난 우울 예측요인은 사회부적응, 주관적 신체증상 및 가족 지지이었다. 로지스틱 회귀분석에서 특이도 93.8%, 민감도 42.5%이었고, 본 연구의 모형 적합도를 roc curve 검증 한 결과 AUC=.84으로 본 연구 모형은 적합(p=<.001)하다고 할 수 있다. 우울예측에 대한 의사결정나무 분석은 분류에 대한 예측 정확도에서 특이도 98.3%, 민감도 20.8%이었고, 전체 분류 정확도는 로지스틱 회귀분석은 82.0%, 의사결정나무 분석은 80.5% 이었다. 본 연구 결과 민감성과 분류 정확도와 더 높게 나타난 로지스틱 회귀분석 방법이 지역 주민의 우울 예측 모형을 구축하는데 더 유용한 자료로 사용될 수 있으리라 사료된다.

분산형 데이터마이닝 구현을 위한 의사결정나무 모델 전송 기술 (The Transfer Technique among Decision Tree Models for Distributed Data Mining)

  • 김충곤;우정근;백성욱
    • 디지털콘텐츠학회 논문지
    • /
    • 제8권3호
    • /
    • pp.309-314
    • /
    • 2007
  • 분산형 데이터마이닝을 위해 의사결정나무 알고리즘은 분산형 협업 환경에 적합하도록 변환되어야 한다. 본 논문에서 제시된 분산형 데이터마이닝 시스템은 각각의 사이트에서 부분적인 데이터를 위한 데이터마이닝 작업을 수행할 수 있는 에이전트와 여러 에이전트들의 협업을 통해 최종적인 의사결정나무 모델을 완성할 수 있도록 에이전트들 간의 통신을 중재하는 미디에이터로 구성되어 있다. 분산형 데이터마이닝의 장점 중에 하나는 여러 사이트에 분산되어 있는 대량의 데이터를 분산 처리하므로 데이터마이닝의 소요시간을 현저하게 줄일 수 있다는 점이다. 그러나 각 사이트들에 존재하고 있는 에이전트들 간의 통신에 부하가 과도하게 걸린다면, 효율적인 시스템으로의 활용도가 낮아질 것 이다. 본 논문은 에이전트들 간에 의사결정나무 모델의 전송량을 최소로 할 수 있는 방법론에 초점을 맞추었다.

  • PDF

패턴의 변화를 가지는 연속성 데이터를 위한 스트리밍 의사결정나무 (Streaming Decision Tree for Continuity Data with Changed Pattern)

  • 윤태복;심학준;이지형;최영미
    • 한국지능시스템학회논문지
    • /
    • 제20권1호
    • /
    • pp.94-100
    • /
    • 2010
  • 데이터 마이닝(Data Mining)은 환경으로부터 수집된 데이터에서 패턴을 추출하고 의미 있는 정보를 발견하기 위하여 주로 사용된다. 하지만, 기존의 방법은 데이터의 수집이 완료된 상태에서 분석하는 것을 기반으로 하고 있으며, 시간의 흐름에 따른 패턴의 변화를 반영하기 어렵다. 본 논문은 연속성(Continuity data), 대량성(Large scale) 그리고 패턴의 가변성(Changed pattern)과 같은 특성을 가지는 스트림 데이터(Stream Data)의 분석을 위한 스트리밍 의사결정 나무(Streaming Decision Tree : SDT) 방법을 소개한다. SDT는 연속적으로 발생하는 데이터를 블록으로 정의하고, 각 블록은 의사결정나무 학습 방법을 이용하여 규칙을 추출한다. 추출된 규칙은 발생 시간, 빈도 그리고 모순 등을 고려하여 결합하였다. 실험에서는 시계열 데이터를 이용하여 분석하였고, 적절한 결과를 확인하였다.