• 제목/요약/키워드: BIG TREE

검색결과 223건 처리시간 0.026초

빅데이터 검색 정확도에 미치는 다양한 측정 방법 기반 검색 기법의 효과 (Impact of Diverse Document-evaluation Measure-based Searching Methods in Big Data Search Accuracy)

  • 김지영;한다현;김종권
    • 정보과학회 논문지
    • /
    • 제44권5호
    • /
    • pp.553-558
    • /
    • 2017
  • 빅데이터의 공급이 늘어남에 따라, 이로부터 유용한 정보를 추출해내기 위한 학계와 업계의 연구가 활발히 진행 되고 있다. 특히 분석한 정보의 특징과 함께, 정보 검색 시 검색자의 의도를 함께 반영하여 정보를 여과해 주는 것이 대부분의 연구의 최종 목표이다. 정확하게 분석된 자료는 기업이 제공하는 서비스에 대한 사용자의 충성도를 높여주고, 사용자 스스로 보다 효율적이고 효과적으로 정보를 이용할 수 있게 된다. 본 논문에서는 가장 높은 빈도로 사용되는 검색 분야인 기사를 검색하는 경우의 정확도를 높이기 위해, 관련 데이터를 TF-IDF, 결정 트리, 코사인 유사도, 단순 베이지안 분류기 등의 다양한 측도방법으로 평가해 보고, 이를 분석하였다. 또한, 분석 결과를 바탕으로 가장 적합한 측도 방법을 제안한다.

빅데이터 기반 시민의견 모니터링 방안 연구 : "경기지역화폐"를 중심으로 (A Study on Monitoring Method of Citizen Opinion based on Big Data : Focused on Gyeonggi Lacal Currency (Gyeonggi Money))

  • 안순재;이새미;유승의
    • 디지털융복합연구
    • /
    • 제18권7호
    • /
    • pp.93-99
    • /
    • 2020
  • 본 연구에서는 비정형적인 대용량의 텍스트 자료로부터 유의미한 정보를 추출하는 빅데이터 분석방법 중 텍스트 마이닝을 이용하여 시행 중인 정책과 제도에 대한 시민의견을 모니터링 할 수 있는지 확인하였다. '경기지역화폐'와 관련된 5,108건의 신문기사와 748건의 온라인 카페글을 수집하여 빈도분석, TF-IDF분석, 연관분석, 워드트리 시각화 분석을 수행하였다. 그 결과로 기사에서는 지역화폐의 도입 목적, 제공되는 혜택, 사용방법에 관련된 내용이 많았고 카페글에서는 지역화폐의 실사용과 관련된 내용 위주로 작성이 되어있음을 확인하였다. 또한 지역화폐 활성화를 위해서 뉴스는 정보전달자로서 지역화폐의 홍보에 관여하고 있었고 카페글은 지역화폐 사용자인 시민들의 의견으로 이루어져 사용과 관련된 실제적인 정보 교환의 장으로 기능하고 있었다. 지역화폐뿐만 아니라 다양한 정책과 제도에 관해서도 SNS와 텍스트 마이닝을 통해 시민들의 의견을 수렴하여 효과적으로 활성화시킬 수 있을 것으로 보인다.

빈도 분석을 이용한 HTML 텍스트 추출 (HTML Text Extraction Using Frequency Analysis)

  • 김진환;김은경
    • 한국정보통신학회논문지
    • /
    • 제25권9호
    • /
    • pp.1135-1143
    • /
    • 2021
  • 최근 빅데이터 분석을 위해 웹 크롤러를 이용한 텍스트 수집이 빈번하게 이루어지고 있다. 하지만 수많은 태그와 텍스트로 복잡하게 구성된 웹 페이지에서 필요한 텍스트만을 수집하기 위해서는 웹 크롤러에 빅데이터 분석에 필요한 본문이 포함된 HTML태그와 스타일 속성을 명시해야 하는 번거로움이 있다. 본 논문에서는 HTML태그와 스타일 속성을 명시하지 않고 웹 페이지에서 출현하는 텍스트의 빈도를 이용하여 본문을 추출하는 방법을 제안하였다. 제안한 방법에서는 수집된 모든 웹 페이지의 DOM 트리에서 텍스트를 추출하여 텍스트의 출현 빈도를 분석한 후, 출현 빈도가 높은 텍스트를 제외시킴으로써 본문을 추출하였으며, 본 연구에서 제안한 방법과 기존 방법의 정확도 비교를 통해서 본 연구에서 제안한 방법의 우수성을 검증하였다.

가변블록 및 가변 탐색구간을 이용한 시차추정 알고리즘 (Disparity Estimation Algorithm using Variable Blocks and Search Ranges)

  • 고제현;송혁;유지상
    • 한국통신학회논문지
    • /
    • 제30권4C호
    • /
    • pp.253-261
    • /
    • 2005
  • 본 논문에서는 MPEG 3DAV Coding에서 진행 중인 EE2 및 EE3의 다시점 영상 압축에 효율적으로 적용할 수 있는 블록기반 시차추정 기법을 제안한다. 제안된 기법은 영상의 특성을 이용하여 블록크기를 가변적으로 구성하는 적응적 시차 추정을 적용하여 영상의 화질을 개선하였다. 추정하고자하는 해당 블록의 주변 특성을 고려하여 탐색 영역을 가변적으로 설정함으로써 계산량을 줄이고 좌우방향으로 시차가 더 크다는 스테레오 영상의 특성을 이용하여 2진과 4진 트리 분해를 혼용함으르써 기존의 4진 트리만 이용한 정보 부호화 방식보다 부가정보량을 감소시킬 수 있다. 모의실험 결과 기존의 전 탐색 영역블록 정합기법(FBMA)에 비해 최대 $68\%$정도 계산량이 감소하고, PSNR면에서 기존 기법들보다 1dB 가량 개선되는 것을 알 수 있다.

결정트리 기반의 기계학습을 이용한 동적 데이터에 대한 재익명화기법 (Re-anonymization Technique for Dynamic Data Using Decision Tree Based Machine Learning)

  • 김영기;홍충선
    • 정보과학회 논문지
    • /
    • 제44권1호
    • /
    • pp.21-26
    • /
    • 2017
  • 사물인터넷, 클라우드 컴퓨팅, 빅데이터 등 새로운 기술의 도입으로 처리하는 데이터의 종류와 양이 증가하면서, 개인의 민감한 정보가 유출되는 것에 대한 보안이슈가 더욱 중요시되고 있다. 민감정보를 보호하기 위한 방법으로 데이터에 포함된 개인정보를 공개 또는 배포하기 전에 일부를 삭제하거나 알아볼 수 없는 형태로 변환하는 익명화기법을 사용한다. 그러나 준식별자의 일반화 수준을 계층화하여 익명화를 수행하는 기존의 방법은 데이터 테이블의 레코드가 추가 또는 삭제되어 k-익명성을 만족하지 못하는 경우에 더 높은 일반화 수준을 필요로 한다. 이와 같은 과정으로 인한 정보의 손실이 불가피하며 이는 데이터의 유용성을 저해하는 요소이다. 따라서 본 논문에서는 결정트리 기반의 기계학습을 적용하여 기존의 익명화방법의 정보손실을 최소화하여 데이터의 유용성을 향상시키는 익명화기법을 제안한다

Use of Information Technologies to Explore Correlations between Climatic Factors and Spontaneous Intracerebral Hemorrhage in Different Age Groups

  • Ting, Hsien-Wei;Chan, Chien-Lung;Pan, Ren-Hao;Lai, Robert K.;Chien, Ting-Ying
    • Journal of Computing Science and Engineering
    • /
    • 제11권4호
    • /
    • pp.142-151
    • /
    • 2017
  • Spontaneous intracerebral hemorrhage (sICH) has a high mortality rate. Research has demonstrated that sICH occurrence is related to weather conditions; therefore, this study used the decision tree method to explore the impact of climatic risk factors on sICH at different ages. The Taiwan National Health Insurance Research Database (NHIRD) and other open-access data were used in this study. The inclusion criterion was a first-attack sICH. The decision tree algorithm and random forest were implemented in R programming language. We defined a high risk of sICH as more than the average number of cases daily, and the younger, middle-aged and older groups were calculated as having 0.77, 2.26 and 2.60 cases per day, respectively. In total, 22,684 sICH cases were included in this study; 3,102 patients were younger (<44 years, younger group), 9,089 were middle-aged (45-64 years, middle group), and 10,457 were older (>65 years, older group). The risk of sICH in the younger group was not correlated with temperature, wind speed or humidity. The middle group had two decision nodes: a higher risk if the maximum temperature was >$19^{\circ}C$ (probability = 63.7%), and if the maximum temperature was <$19^{\circ}C$ in addition to a wind speed <2.788 (m/s) (probability = 60.9%). The older group had a higher risk if the average temperature was >$23.933^{\circ}C$ (probability = 60.7%). This study demonstrated that the sICH incidence in the younger patients was not significantly correlated with weather factors; that in the middle-aged sICH patients was highly-correlated with the apparent temperature; and that in the older sICH patients was highly-correlated with the mean ambient temperature. "Warm" cold ambient temperatures resulted in a higher risk of sICH, especially in the older patients.

Biotic and spatial factors potentially explain the susceptibility of forests to direct hurricane damage

  • Kim, Daehyun;Millington, Andrew C.;Lafon, Charles W.
    • Journal of Ecology and Environment
    • /
    • 제43권4호
    • /
    • pp.364-375
    • /
    • 2019
  • Background: Ecologists continue to investigate the factors that potentially affect the pattern and magnitude of tree damage during catastrophic windstorms in forests. However, there still is a paucity of research on which trees are more vulnerable to direct damage by winds rather than being knocked down by the fall of another tree. We evaluated this question in a mixed hardwood-softwood forest within the Big Thicket National Preserve (BTNP) of southeast Texas, USA, which was substantially impacted by Hurricane Rita in September 2005. Results: We showed that multiple factors, including tree height, shade-tolerance, height-to-diameter ratio, and neighborhood density (i.e., pre-Rita stem distribution) significantly explained the susceptibility of trees to direct storm damage. We also found that no single factor had pervasive importance over the others and, instead, that all factors were tightly intertwined in a complex way, such that they often complemented each other, and that they contributed simultaneously to the overall susceptibility to and patterns of windstorm damage in the BTNP. Conclusions: Directly damaged trees greatly influence the forest by causing secondary damage to other trees. We propose that directly and indirectly damaged (or susceptible) trees should be considered separately when assessing or predicting the impact of windstorms on a forest ecosystem; to better predict the pathways of community structure reorganization and guide forest management and conservation practices. Forest managers are recommended to adopt a holistic view that considers and combines various components of the forest ecosystem when establishing strategies for mitigating the impact of catastrophic winds.

의사결정나무의 분기법 변화가 예측력에 미치는 영향 (The impact of the change in the splitting method of decision trees on the prediction power)

  • 장영재
    • 응용통계연구
    • /
    • 제35권4호
    • /
    • pp.517-525
    • /
    • 2022
  • 빅데이터 시대에 이르러 다양한 데이터 마이닝 기법이 주요 분석 방법론으로 제안되었다. 복잡 다양한 데이터가 양산되면서 데이터 마이닝 기법은 데이터 과학의 토대를 이루는 방법으로 부각되었다. 본고에서는 해석의 유용성과 예측력 향상의 측면 모두에 초점을 맞추어 다양한 실험 연구를 시행하였다. 구체적인 모형으로는 의사결정나무를 선택하였는데, 이는 실무적 사용 빈도가 높은 방법으로서 활용 폭이 넓을 뿐만 아니라 이해가 쉽고 성능평가가 용이한 방법론이기 때문이다. 의사결정나무모형을 대상으로 이 모형의 구조를 크게 변형시키지 않으면서도 예측력 향상의 목적을 이룰 수 있는 방법을 살펴보았으며 분기변수의 선택 방법이 모형의 성능에 미치는 영향을 분석하였다. 이 효과를 측정하기 위해서 다양한 모의실험 모델을 생성하고 분기법의 변화에 따른 예측력을 비교하였다. 비선형성을 지니면서 단일 분할을 통해서 하위 집합으로 명확하게 구분하기 어려운 복잡한 데이터의 경우에는 선형결합 분기방법이 예측력 제고에 도움을 주는 것으로 나타났다.

철도건설사업의 6시그마의 효율적 적용방안 (Efficient Application Way of Six Sigma at Railway Construction Project)

  • 홍성희;정성봉
    • 한국철도학회:학술대회논문집
    • /
    • 한국철도학회 2011년도 정기총회 및 추계학술대회 논문집
    • /
    • pp.1251-1262
    • /
    • 2011
  • 건설업계에서는 경영효율화를 위해서 지난 2000년도부터 6시그마 방법론을 도입하여 적용하였으나 건설사업의 특수성 때문에 6시그마 적용이 사례가 많지 않다. 특히 철도건설사업은 일반적인 건설사업의 특성 외에도 다양한 공종의 집합체로 이루어진 복합공종의 건설사업이라는 특수성을 띄고 있어 적용사례는 더욱 드물다. 국내 철도건설 및 시설관리업무를 담당하는 K-공단은 2004년부터 6시그마를 도입하여 경영전반에 적용하고 있다. 지난 수년 동안 6시그마를 추진한 결과 개선안에 대한 CTQ 목표 달성도가 낮아 원인분석을 통해 합리적인 적용방안을 제시하고자 본 연구를 시작하였다. 선행 연구에 따르면 개선안 실행에 대한 CTQ 목표 달성에 성공한 프로젝트는 약 41%라고 분석되었다(성공기준:CTQ달성도 0.5이상). 본 연구에서는 2004년부터 2009년까지 수행한 프로젝트를 중심으로 개선안 실행에 따른 CTQ달성도를 분석하고 실행한 담당자에 대한 설문 및 인터뷰를 통해 실패한 요인을 파악하고자 하였다. 분석결과 CTQ달성에 영향을 주는 요인으로 1)과제추진 시의 과제수준(업무범위에 따라 BIg Y, Small y), 2)마스터 스폰서 및 스폰서가 과제 및 과제 담당자에 대한 강한 리더십 3)개선안 실행에 대한 지속적인 모니터링과 피드백 등이 파악되었다. 이러한 문제점을 해결하기 위하여 1)과제 종류에 대한 재 정의의 필요성의 제시하였다. 챔피언 과제, BB과제, QW과제로 분류되는 기준을 재정립할 필요가 있다. 2)CTQ Tree를 이용하여 Big Y로부터 small y를, small y로부터 단위과제를 도출하여 실행과제로 추진하도록 하였으며, 3) 마스터 스폰서, 스폰서의 리더십을 위해 성과관리에서 강한 incentive 제공 등 동기부여를 하도록 하였다. 4)스폰서 및 담당직원의 모니터링을 위해 해당 시스템에 모니터링 기능을 강화하고 지속적인 학습을 제공을 합리적 적용을 위한 방안으로 제시하였다.

  • PDF

갈색여치(Paratlanticus ussuriensis) 기주식물의 이화학적 특성변화와 먹이선호 구명 (The Physio-chemical Variation of the Host Plants and Feed Preference of the Ussur Brown Katydid, Paratlanticus ussuriensis (Orthoptera: Tettigoniidae))

  • 김명현;방혜선;정명표;나영은;한민수;강기경;이덕배
    • 한국환경농학회지
    • /
    • 제28권4호
    • /
    • pp.356-364
    • /
    • 2009
  • In 2006 and 2007, there was a big outbreak of the Ussur Brown Katydid, Paratlanticus ussurriensis in the central part of Korea attacking some orchard trees. Until 2000, the katydid had not been regarded as an agricultural pest because they were distributed widely in Korea with low population density and their habitats were confined mainly to hillsides of forested areas. The fact that katydid attacked orchard trees with a higher population density seemed to be related to a change in feeding environment. And the shift of their habitats from oak woodlands to commercial orchards was thought to be related to the nutritional contents of their feed. In an attempt to understand these relationships, we conducted an ecological study of the affected areas. When the katydids changed their habitats in early May of 2008 and 2009, they shifted their host plants from oak trees to peach trees. The habitat shift was closely related to the nitrogen (N) content of the host plant leaves. When katydid moved to the hillside adjacent to orchard farm, N content of oak tree leaves decreased dramatically from 5.3% to 2.2%. At that time N content of peach tree leaves were higher than the 2.2% of oak leaves, showing 3.5~5.0%. This range of N content of peach tree leaves has been consistent until late June. And feed preference analysis carried out in the laboratory showed that katydid prefered peach tree leaves to peach fruit to oak tree leaves.