• 제목/요약/키워드: 유사도 비

검색결과 8,122건 처리시간 0.04초

텍스트 문서 분류에서 범주간 유사도와 계층적 분류 방법의 성과 관계 연구 (A Study on the Relationship between Class Similarity and the Performance of Hierarchical Classification Method in a Text Document Classification Problem)

  • 장수정;민대기
    • 한국전자거래학회지
    • /
    • 제25권3호
    • /
    • pp.77-93
    • /
    • 2020
  • 비정형 텍스트 문서를 다중 범주로 분류하는 문제에 있어서, 계층적 분류 방법이 비계층적 분류 방법에 비하여 분류 성능이 우수한 것으로 알려져 있다. 기존 문헌과 다르게 본 연구에서는 사전에 범주들의 계층 구조가 정의된 상황에서 계층적 분류 방법과 비계층적 분류 방법의 성능을 비교하였다. 수자원 분야 기후변화 적응기술과 관련한 논문 분류 데이터와 20NewsGroup 오픈 데이터를 대상으로 계층적/비계층적 분류 방법의 성능을 비교하였다. 본 연구결과 기존 문헌과 다르게 계층적 분류 방법이 비계층적 분류 방법에 비하여 언제나 성능이 우수한 것은 아님을 확인하였다. 계층 구조의 상위/하위 수준에서의 상대적 유사도에 따라서 계층적/비계층적 분류 방법의 성능에 차이가 있음을 확인하였다. 즉, 상위 수준의 유사도가 하위 수준보다 상대적으로 낮은 경우 상위 수준에서의 오분류 감소로 계층적 분류 방법의 성능이 개선됨을 확인하였다.

비음수 행렬 분해와 K-means를 이용한 주제기반의 다중문서요약 (Topic-based Multi-document Summarization Using Non-negative Matrix Factorization and K-means)

  • 박선;이주홍
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제35권4호
    • /
    • pp.255-264
    • /
    • 2008
  • 본 논문은 K-means과 비음수 행렬 분해(NMF)를 이용하여 주제기반의 다중문서를 요약하는 새로운 방법을 제안하였다. 제안방법은 비음수 행렬 분해를 이용하여 가중치가 부여된 용어-문장 행렬을 희소(Sparse)한 비음수 의미특징 행렬과 비음수 변수 행렬로 분해함으로써 직관적으로 이해할 수 있는 형태의 의미적 특징을 추출할 수 있고, 주제와 의미특징간의 유사도에 가중치를 부여하여 유사도는 높으나 실제 의미 없는 문장이 추출되는 것을 막는다. 또한 K-means 군집을 이용하여 문장에 포함된 노이즈를 제거함으로써 문서의 의미가 요약에 편향되게 반영하는 것을 피할 수 있고, 추출된 문장에 부여된 순위순서대로 정렬하여 보여 줌으로써 응집성을 높인다. 실험 결과 제안방법이 다른 방법에 비하여 좋은 성능을 보인다.

설계가중치를 이용한 유사 최량선형 비편향 예측

  • 신동윤;신민웅
    • 한국통계학회:학술대회논문집
    • /
    • 한국통계학회 2004년도 학술발표논문집
    • /
    • pp.161-164
    • /
    • 2004
  • You 와 Rao (2002)는 소지역 추정시 유사 최량선형 비편향 예측에서 설계 가중 값을 사용하는 방법을 발전시켰다. 특히 소지역 평균들을 추정하기 위하여 유사-최량선형 비편향 예측 추정량을 제안하였다. 우리는 소지역 추정에서 실용적으로 이용되는 몇 가지 추가적인 성질을 연구하였다.

  • PDF

점착성 유사의 이동 모형화 및 적용 (Development and application of cohesive sediment transport model)

  • 손민우;이관홍
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2011년도 학술발표회
    • /
    • pp.331-335
    • /
    • 2011
  • 흔히 진흙으로 불리는 점착성 유사는 모래 등의 비점착성 유사와는 다른 특성을 보인다. 가장 큰 특징은 점착력에 의해 서로 엉겨 붙어 큰 덩어리(플럭)를 형성하고 다시 큰 플럭이 파괴되는 과정인 응집현상(Flocculation Process)을 보인다는 것이다. 이 응집현상의 과정을 통해 플럭은 크기 및 밀도를 지속적으로 변화시킨다. 크기 및 밀도의 변화는 플럭의 침강속도를 변화시켜 점착성 유사의 부유, 퇴적, 이송, 확산의 과정에 직접적인 영향을 미친다. 응집현상은 플럭의 침강속도 뿐 아니라 부피농도와 질량농도 사이의 비선형적 관계를 야기하여 흐름 운동량 방정식 유도, 난류의 모형화 등에서도 비점착성 유사와 다른 방향으로 진행된다. 점착성 유사가 우세한 지역의 또 다른 특성은 자기하중에 의한 압밀현상에 따라 발생하는 가변적인 한계소류력이다. 따라서 점착성 유사의 이동을 모형화 하는 과정에서는 가변적인 침식율의 가정 등을 통해 이에 대한 고려가 반드시 이루어져야 한다. 흐름의 운동량 방정식 및 난류 모형에서는 플럭의 부피 농도와 질량농도가 각 항의 물리적 의미에 부합하도록 개별적으로 선택 및 적용되어야 질량보존의 문제 등으로 발생할 수 있는 계산상의 오류를 배제할 수 있다. 적용 결과, 점착성 유사가 우세한 지역에서 나타나는 높은 부유 및 흐름정체기에서의 부유사 존재 등의 특성이 점착성 유사 이동을 위한 모형에서 보다 합리적으로 계산된다는 사실이 확인되었다. 그리고 비점착성 유사에 적합한 이동 모형이 점착성이 우세한 지역에 적용될 경우, 상황에 따라 유사량을 과대 및 과소 산정할 수 있다는 결론이 도출되었다. 조류의 영향이 존재하는 하구부의 경우에는 조류의 형태와 비대칭성에 따라 유사량의 차이가 큰 것으로 나타났다. 조류의 형태는 주로 하구부의 지형에 의해 결정되므로 준설, 매립, 확폭 등과 같은 하구부에서의 사업이 진행되는 경우, 유사량 변화에 대한 고려가 반드시 이루어져야 할 것으로 판단된다.

  • PDF

다차원척도법과 거리분석을 활용한 그룹화된 비유사성에 대한 비모수적 접근법 (Non-parametric approach for the grouped dissimilarities using the multidimensional scaling and analysis of distance)

  • 남승찬;최용석
    • 응용통계연구
    • /
    • 제30권4호
    • /
    • pp.567-578
    • /
    • 2017
  • 일반적으로 그룹화된 다변량자료는 다변량 분산분석(multivariate analysis of variance; MANOVA)을 사용하여 그룹 간 차이를 검정할 수 있다. 그러나 만약 다변량 분산분석의 기본적인 가정이 위배되면 이 방법은 적절하지 못하다. 이 경우 다양한 거리로부터 그룹화된 비유사성을 계산한 후 다차원척도법(multidimensional scaling; MDS), 거리분석(analysis of distance; AOD) 그리고 비모수적 기법인 순열검정(permutation test)을 적용하여 문제를 해결할 수 있다. 다차원척도법은 비유사성으로부터 개체들의 좌표를 계산해주며 거리분석은 이 좌표를 활용하여 그룹구조를 파악하는데 유용하다. 특히 비유사성의 측도로 유클리드 거리를 사용하면 거리분석은 다변량 분산분석과 수리적으로 매우 밀접한 연관관계를 맺는다. 따라서 본 연구에서는 그룹화된 비유사성에 다차원척도법과 거리분석을 적용하여 그룹 내와 그룹 간의 구조를 파악하고 순열검정을 위한 새로운 검정통계량을 제안하려 한다. 덧붙여 유클리드 거리를 활용한 비유사성을 통해 거리분석과 다변량 분산분석과의 수리적 연관성을 고찰하고자 한다.

비유사량(比流砂量) 추정방법의 개발(II) - 모형 개발 및 검토 - (Development of Methods for Estimating Sediment Yield Rate(II) - Development of Models -)

  • 김창완;김형섭;유권규;우효섭
    • 대한토목학회논문집
    • /
    • 제13권1호
    • /
    • pp.131-140
    • /
    • 1993
  • 본 연구의 주요 목적은 댐 설계를 위한 유역의 비유사량 추정방법을 개발하는 것으로 유역면적 $200km^2{\sim}2,000km^2$의 중규모 유역을 대상으로 한다. 이를 위하여, 먼저 연구(I)에서는 비유사량 추정방법의 개발방향을 결정하고, 기존 저수지 퇴사자료에서 5점과 하천 유사량 실측 자료에서 8 점 등 총 13 점의 비유사량 자료를 도출하였다. 본 연구(II)에서는 이러한 중규모 유역에서 수집된 유역 비유사량 자료와 유역특성 인자들을 이용하여 3 변수 경험공식과 6 변수 도표식 방법을 개발하였다. 제한된 범위와 비교 분석 결과, 본 연구에서 개발된 방법들은 기존의 방법들보다 모형 개발에 이용된 자료의 범위와 신뢰도 면에서 적용성이 높은 것으로 나타났다. 한편, 본 연구에서 수집된 비유사량 자료 및 개발된 모형에 의하면, 우리나라에서 중규모 유역의 경우 비유사량의 하한치는 $100tons/km^2/yr$정도이며 상한치는 $1,000tons/km^2/yr$ 정도로 추정된다.

  • PDF

미계측유역 유사량 예측 모델을 이용한 비유사량 특성분석 (Analysis of specific sediment yield characteristics using sediment prediction models developed for ungauged watersheds)

  • 박상덕;안태진;임경재;김정곤;신승숙
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2017년도 학술발표회
    • /
    • pp.33-33
    • /
    • 2017
  • 수문모형들은 유역차원의 저감대책 수립 및 평가에 유용하게 사용될 수 있고 이를 활용한 합리적인 예측이 가능하다. 한국의 미계측 유역에 대한 유사발생량 예측을 모델을 개발하였다. 본 연구에서 개발한 예측모형의 특징은 신뢰할 수 있는 관측 자료를 활용하여 단계별 다중회귀분석을 이용하여 매개변수를 결정하였으며, 최소한의 입력자료를 이용하여 전국 규모의 연평균 유사발생량을 예측할 수 있다는 것이다. 본 연구에서 개발된 모형을 활용하여 4대강 유역의 중권역별 유사량을 추정하였다. 수자원장기 종합에서 사용한 중권역별 강우 자료를 활용하여 모의를 수행하였다. 2001년부터 2015년 까지 15년까지 모의결과 4대강 유역 전체적으로 연 강우량의 변동에 따라 유사발생량도 증감하는 패턴을 나타내고 있으며, 그 주기는 약 8년 정도로 추정되었다. 4대강 주요 중권역을 대상으로 2010년에 추정된 비유사량을 K-DRUM 예측값 및 유량조사사업단 추정값과 비교하여 모델의 활용성을 검토하였다. 유사량 예측의 불확실성을 감안할 때 본 연구에서 개발된 모델을 이용하여 1차 스크리닝 수준에서 미계측 유역에 대한 비유사량 예측이 가능할 것으로 판단되며, 향후 미계측 유역에 대한 유사관리계획 수립에 활용될 수 있을 것으로 판단된다.

  • PDF

중복을 허용하는 계층적 클러스터링 기법에서 클러스터 간 유사도 평가 (A Novel Linkage Metric for Overlap Allowed Hierarchical Clustering)

  • 전준우;송광호;김유성
    • 한국어정보학회:학술대회논문집
    • /
    • 한국어정보학회 2016년도 제28회 한글및한국어정보처리학술대회
    • /
    • pp.157-161
    • /
    • 2016
  • 본 논문에서는 클러스터 간의 중복을 허용한 계층적 클러스터링(hierarchical clustering) 기법에 적합한 클러스터 간 유사도 평가방법(linkage metric)을 제안하였다. 클러스터 간 유사도 평가방법은 계층적 클러스터링에서 클러스터를 통합하거나 분해하는데 쓰이며 사용된 방법에 따라 클러스터링의 결과가 다르게 형성된다. 기존의 클러스터 간 유사도 평가방법인 single linkage, complete linkage, average linkage 중 single linkage와 complete linkage는 클러스터 간 중복이 허용된 환경에서 정확도가 낮은 문제점이 있고, average linkage는 정확도가 두 방법에 비해 높지만 계산 시간 소요가 크다는 단점이 있다. 따라서 본 논문에서는 기존의 average linkage를 개선하여 중복된 데이터에 의한 필요 계산량을 크게 줄임으로써 시간적 성능이 우수한 클러스터 간 유사도 평가방법을 제안하였다. 또한, 제안된 방법을 기존 방법들과 비교실험하여 중복을 허용하는 계층적 클러스터링 환경에서 정확도는 비슷하거나 더 높고, average linkage에 비해 계산량이 감소됨을 확인하였다.

  • PDF

국내 하천 유사 특성 이해와 유사량 추정을 위한 경험적 모델 개발 (Understanding sediment characteristics and developing empirical model for specific degradation in South Korean river)

  • 강우철
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2023년도 학술발표회
    • /
    • pp.133-133
    • /
    • 2023
  • 풍화작용에 의해 생성된 유사는 자연 매체에 의해 이동하고 하천에 도달하기 이전이나 이후 퇴적되며, 해당 과정 중에서 하상변동, 홍수위 상승, 제방 안정성, 두부 침식, 생태환경 변화, 수질문제 등 다양한 침식과 퇴적 관련 문제들이 발생한다. 이러한 유사 문제의 해결과 지속적인 하천관리를 위해서는 유사의 생성, 이송, 그리고 퇴적 과정에 대한 충분한 이해와 정량적인 유사량을 파악하는 것이 필수적이다. 다양한 연구들을 통해서 유사량을 정량적으로 파악하기 위해 여러 종류의 모델과 공식들이 제안 되어져 왔다. 그 중 경험적 모델의 경우 실제로 관측된 값을 기반으로 하며, 복잡한 계산이나 요구하는 자료가 다른 종류의 모델들 보다 적어 쉽게 접근이 가능하다. 이러한 경험적 모델은 유사에 영향을 주는 인자를 규명하거나 특정 유역이나 지역에서 이송 및 퇴적 되는 유사의 출처와 특성을 규명하는 초기 단계에서 유용하게 이용된다. 국내 하천의 경우 여름에 강우가 집중되고 대부분의 국토가 산지로 이루어져있어 상류에서 침식이 주로 발생한다. 또한, 본류 및 하류 지역의 하천은 유사의 퇴적이 주로 일어나서 하천의 형태와 물길이 형성된 충적 하천 형태로 발전 되어있기 때문에 국내 하천에서는 전반적으로 국부적이며 다양한 형태의 유사 관련 문제가 발생한다. 국내 하천에서 발생하는 유사 관련 문제를 해결하기 위해 국내 하천의 유사량을 추정하는 다양한 경험적 모델들이 지속적으로 개발되어왔다. 하지만 과거에 개발된 모델들의 경우 계측 자료가 충분하지 않은 시기에 개발 되었으며, 현재에는 활용하기 불가능하다. 본 연구에서는 국내 하천의 비유사량을 예측하는 동시에 국내 하천의 유사 특성을 이해하기 위해 과거에 국내 하천을 대상으로 비유사량을 추정하기 위해 개발되었던 경험적 모델을 개선하였다. 본 연구를 통해 기존 경험 모델의 경우 주기적인 업데이트가 필요함을 확인하였으며, 개발된 모델의 경우 국내 하천 유사 관리를 위해 미래 유사량 예측하는 등 다양한 방면으로 활용 관리가 가능할 것으로 보인다.

  • PDF

실측 유사량 데이터베이스를 기반으로 한 국내 하천의 유사이송 특성 분석 (Analysis on Sediment Transport Characteristics for River in Korea based on Measured Sediment Discharge Databas)

  • 장은경;지운;여운광
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2017년도 학술발표회
    • /
    • pp.3-3
    • /
    • 2017
  • 하천에서 발생하는 유사량은 공급능력이 흐름의 이송능력보다 지배적인 경우 같은 유량이 발생하더라도 유사량이 다르게 관측될 수 있다. 특히 국내 하천과 같이 홍수기가 특정기간에 편중되어 연중 유량발생 편차가 매우 크게 나타나는 경우 이와 같은 현상이 더욱 두드러지게 발생한다. 즉, 대부분의 연중발생 유사량이 홍수시에 이동하고 홍수발생 초기와 후기의 유사 공급능력의 차이가 나타나는 국내하천의 경우 이를 기존의 유사이송공식으로 정량적인 유사량 값을 추정하는데는 한계가 있음을 의미한다. 따라서 본 연구에서는 국내 하천에서 실측한 유사량 자료를 종합하고 주요 지점별, 연도별, 계절별, 하천 유역별로 분류한 후 이를 분석하여 국내하천의 유사량 발생 특성을 규명하였다. 실측 유사량 데이터베이스는 국내 하천의 주요지점에서 2007년부터 2012년까지 측정한 자료로 구성되어 있으며 총 26개 지점 1,283개의 자료를 포함하고 있다. 4대강의 본류 대표지점으로 선정된 여주, 왜관, 공주, 나주지점을 대상으로 유량-총유사량 관계를 비교한 결과, 여주지점의 유량 증가에 따른 총유사량 증가 폭이 다른 대표지점들에 비해 가장 크게 나타나는 반면, 나주지점의 경우 제일 작은 값을 보인다. 또한 본류의 유량-유사량 관계식의 지수 값이 본류와 지류를 모두 포함한 관계식에 비해 더 크게 나타나는데 이는 지류에서는 본류보다 적은 유량이 발생하더라도 유사 이송량은 상대적으로 크게 발생한다는 것을 의미하며 그 이유는 본류와 지류에서 유사 이송이 지배적으로 발생하는 유량범위가 상이하기 때문에 나타나는 결과로 추정할 수 있다. 대표지점별 부유사 농도를 분석한 결과, 7월과 8월 부유사 농도에 비해 9월에 발생하는 부유사 농도가 현저히 낮은 값을 보이는데 이는 연중 홍수기 전반기에 유사 공급량이 상대적으로 많아 나타나는 현상으로 판단된다.

  • PDF