• 제목/요약/키워드: Frequent Items

검색결과 263건 처리시간 0.026초

전자상거래 추천을 위한 RFM기반의 점진적 빈발 패턴 마이닝 기법 (RFM based Incremental Frequent Patterns mining Method for Recommendation in e-Commerce)

  • 조영성;문송철;류근호
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2012년도 제46차 하계학술발표논문집 20권2호
    • /
    • pp.135-137
    • /
    • 2012
  • 기존의 연관규칙을 이용한 추천시스템은 점진적으로 증가하는 트랜잭션 데이터를 처리하기 위해서 기존에 처리한 데이터를 재처리하는 비효율성의 문제가 있다. 본 논문에서는 전자상거래에서 RFM(Recency, Frequency, Monetary)기반의 점진적 빈발 패턴 마이닝을 이용한 추천기법을 제안한다. 제안 방법은 새로운 트랜잭션 데이터가 추가 되었을 때 보다 빠른 시간 내에 연관규칙을 추출이 가능하다.

  • PDF

데이터 스트림 환경에서 효율적인 빈발 항목 집합 탐사 기법 (A Method for Frequent Itemsets Mining from Data Stream)

  • 서복일;김재인;황부현
    • 정보처리학회논문지D
    • /
    • 제19D권2호
    • /
    • pp.139-146
    • /
    • 2012
  • 데이터 마이닝은 다양한 분야에서 축적된 데이터로부터 필요한 지식을 탐사하기 위하여 널리 이용되고 있다. 연관규칙을 탐사하기 위하여 이벤트의 빈발 횟수에 기반을 둔 많은 방법들이 존재하지만, 이들은 이벤트가 연속적으로 발생하는 스트림 환경에는 적합하지 않다. 또한 실시간으로 연관규칙을 탐사해야 하는 스트림 환경에 적용하기에는 많은 비용이 든다. 이 논문에서는 스트림 환경에서 연관규칙을 탐사하기 위한 새로운 방법을 제안한다. 제안하는 방법은 데이터 스트림에서 목적 이벤트의 발생 간격에 따른 가변 윈도우로부터 이벤트의 존재 유무에 근거한 COBJ(Count object) 계산법을 이용하여 데이터 항목을 추출한다. 추출된 데이터는 FPMDSTN(Frequent Pattern Mining over Data Stream using Terminal Node) 알고리즘을 통해 실시간으로 연관규칙을 탐사한다. 실험 결과를 통해 제안하는 방법이 기존의 방법에 비해 스트림 환경에 효율적임을 보인다.

민감한 빈발항목집합을 숨기기 위한 경계기반 HSFI 알고리즘 (Border-based HSFI Algorithm for Hiding Sensitive Frequent Itemsets)

  • 이단영;안형근;고재진
    • 한국멀티미디어학회논문지
    • /
    • 제14권10호
    • /
    • pp.1323-1334
    • /
    • 2011
  • 민감한 정보 숨기기 알고리즘은 민감한 정보를 보호하기 위하여 트랜잭션 데이터베이스를 삭제한다. 데이터 변경은 삭제 접근 방법들 중 하나이다. 민감한 정보를 숨기는 이전 연구들은 결과 데이터베이스의 품질을 유지하기 위해 서로 다른 휴리스틱 알고리즘을 적용했다. 그러나 민감한 정보를 숨기는 과정에서 변경되는 항목집합에 대한 영향을 평가하거나 숨겨지는 항목을 감소시키는 연구들은 미흡하였다. 본 논문에서는 민감한 빈발 항목집합을 숨기기 위하여 경계기반의 HSFI(Hiding Sensitive Frequent Itemsets) 알고리즘을 제안한다. 본 알고리즘에서 FP-Tree의 노드 정보는 기존과는 다르게 빈발 항목집합 생성단계에서 트랜잭션 정보와 민감 정보, 경계 정보를 모두 구성하며, 숨기는 과정에서 비민감한 빈발 항목집합의 영향을 줄이기 위하여 경계를 사용하였다. 본 논문의 예시 트랜잭션 데이터베이스에 HSFI를 적용한 결과, 손실 항목을 크게 감소시킴으로써 기존 방법들에 비해 효과적임을 증명하였고, 보다 개선된 데이터베이스의 품질을 유지할 수가 있었다.

생물학적 데이터 서열들에서 빈번한 최대길이 연속 서열 마이닝 (Mining Maximal Frequent Contiguous Sequences in Biological Data Sequences)

  • 강태호;유재수
    • 정보처리학회논문지D
    • /
    • 제15D권2호
    • /
    • pp.155-162
    • /
    • 2008
  • DNA 염기 서열이나 단백질 아미노산 서열과 같은 생물학적 서열 데이터들은 일반적으로 많은 수의 항목들을 가지고 있다. 생물학적 데이터 서열들에는 보통 빈번하게 발생하는 수 백개의 항목으로 이루어진 연속된 서열들이 존재한다. 이들 서열들에서 빈번하게 발생하는 연속 서열을 검색하는 것은 생물학적 서열 분석에서 중요한 부분을 차지하고 있다. 이전에는 순차 패턴을 효과적으로 발견하고자 하는 많은 연구들이 수행되었으며 대부분의 기존 순차패턴 마이닝 기법들은 Apriori 알고리즘을 기반으로 한다. PrefixSpan 알고리즘은 Apriori 기반의 가장 효율적인 순차패턴 마이닝 기법이다. 하지만 이 알고리즘은 길이-1인 빈발 패턴들로 부터 서열 패턴을 확장해나가는 방식이다. 따라서 길이가 긴 연속 서열을 포함하는 생물학적 데이터서열들에 대한 검색방법으로는 적합하지 않다. 최근에는 기존의 PrefixSpan방식을 이용하면서도 반복적인 처리과정을 줄인 MacosVSpan이 제안되었다. 하지만 이 알고리즘 또한 길이가 긴 생물학적 데이터 서열들로부터 빈번하게 발생하는 연속 서열들을 검색하기에는 효율적이지 않다. 본 논문에서는 많은 양의 생물학적 데이터 서열들로부터 빈번한 연속서열을 고정길이 확장 트리를 이용하여 효과적으로 찾아내는 방법을 제안한다. 그리고 다양한 환경에서 실험을 통해 제안하는 방식이 MacosVSpan알고리즘에 비해 검색성능이 보다 우수함을 보인다.

RFM기반 FP-tree 마이닝을 이용한 개인화 추천시스템 (Personalized Recommendation System using FP-tree Mining based on RFM)

  • 조영성;류근호
    • 한국컴퓨터정보학회논문지
    • /
    • 제17권2호
    • /
    • pp.197-206
    • /
    • 2012
  • 기존의 연관규칙을 이용한 추천시스템은 매번 계속적으로 대량의 데이터를 스캔해야 하므로 속도가 느릴 뿐 아니라 확장성 문제와 정확도 문제가 있다. 본 논문에서는 사용자의 평가 자료에 의존하지 않고 묵시적인(Implicit)방법을 이용하여 RFM(Recency, Frequency, Monetary)기반 FP-tree 마이닝을 이용한 개인화 추천시스템을 제안한다. 구매 가능성이 높은 아이템을 찾기 위해서 고객정보와 구매이력정보를 기반으로 고객과 아이템의 속성 반영이 가능한 RFM기법과 FP-tree 마이닝을 이용한다. 제안 방법으로 RFM기반의 FP-tree 마이닝을 이용하여 후보집합의 발생없이 빈발항목을 구성하고 연관규칙을 생성한다. 생성된 연관규칙의 지지도, 신뢰도, 향상도를 사용하여 추천 효율성이 높은 아이템 추천이 가능하다. 성능평가를 위해 현업에서 사용하는 인터넷 화장품 아이템 쇼핑몰의 데이터를 기반으로 데이터 셋을 구성하여 기존의 시스템과 비교 실험을 통해 성능을 평가하여 효용성과 타당성을 입증하였다.

의료팀에 의하여 발생되는 입원환자의 불안요인에 관한 조사연구 (A Study of Factors Causing Anxiety of Patients by Medical Personnel)

  • 김정화
    • 대한간호학회지
    • /
    • 제6권2호
    • /
    • pp.18-24
    • /
    • 1976
  • This study to find out the causes and degree of anxiety experienced by hospitalized patients, with the objective of instituting improvement of Nursing care program based on the needs of patients. The present study was carry out from July 1 , 1975 to October 10, 1975 with 168 patients random sampling from those admitted of Kyung Hee Medical Center. The Questionnaire form included 47 questions which are considered to be anxiety events for admitted patients and was divided into four areas namely, such events related to 1) hospital environment, 2) Psychology and emotion, 3) Nursing care and treatment, and 4 )Education. The results of the study were as follows : 1) Most of the respondents (70.09%) felt uneasy about their disease affected by the behaviors of medical personnel. 2) Regarding the correlation between anxiety felt by patients and their educational level. Only 9 sub- items of 47 items showed significant difference. 3) There was revealed no particular significance in the correlation between anxiety felt by patients and period of hospitalization. 4) Only 5 sub- items out of 47 items showed significant difference ill the correlation between anxiety felt by patients and previous experience of operation. 5) Only 3 sub-items out of 47 items showed signigicant difference in the correlation between anxiety felt day patients and previous experience of hospitalization. 6) Regarding the extent of anxiety felt by patients, "insufficient explanation about meals" showed the highest score followed. "The visit of physicians and Nurses to the patient is too frequent " showed the lowest score and "Nurses change too frequently the physical posture of patients" followed.

  • PDF

Prefix-트리를 이용한 동적 가중치 빈발 패턴 탐색 기법 (Efficient Dynamic Weighted Frequent Pattern Mining by using a Prefix-Tree)

  • 정병수
    • 정보처리학회논문지D
    • /
    • 제17D권4호
    • /
    • pp.253-258
    • /
    • 2010
  • 지금까지의 빈발 패턴(Frequent Pattern) 마이닝에서는 각 항목들의 중요도(Weight)는 모든 같은 값으로 다루어 왔으나 실 환경에서는 각 항목들의 중요도가 다르게 적용되는 경우가 많이 있고 또 같은 항목이라도 시간에 따라 다른 중요도 값으로 다루어져야 할 경우가 있다. 비즈니스 데이터 분석 환경이나 웹 클릭 데이터 분석 환경과 같은 응용에서도 동적으로 변하는 중요도를 고려하여야 한다. 지금까지 항목의 중요도를 고려하는 여러 패턴 마이닝 기법들이 제안되고 있으나 동적으로 변하는 항목의 중요도를 고려하는 연구는 발표되지 않고 있다. 본 논문에서는 처음으로 동적인 항목들의 중요도(혹은 가중치)를 고려하는 빈발 패턴 마이닝 알고리즘을 제안한다. 제안하는 기법은 단 한번의 데이터베이스 스캔으로 처리되므로 스트림 데이터를 분석할 수 있다. 여러 실험을 통하여 제안하는 기법은 매우 효과적이며 확장성이 좋은 것임을 보인다.

Risk Factors of Prostate Cancer: a Case-control Study in Faisalabad, Pakistan

  • Bashir, Muhammad Naeem;Ahmad, Muhammad Riaz;Malik, Akram
    • Asian Pacific Journal of Cancer Prevention
    • /
    • 제15권23호
    • /
    • pp.10237-10240
    • /
    • 2015
  • Background: Prostate cancer is the third most commonly diagnosed cancer among males in Pakistan but very little is known about risk factors among the Pakistani population. Therefore a hospital-based, case-control study was carried out in Faisalabad to identify potential risk factors. Materials and Methods: This study was based on 140 prostate cancer cases and 280 normal controls. Logistic regression was used to estimate odds ratios and 95% confidence intervals for odds ratios to assess the relationship between prostate cancer and different risk factors. Results: Family history of prostate cancer, age, smoking, obesity, consumption of red meat and frequent use of fat items significantly increased the prostate cancer risk (odds ratios and 95% confidence intervals of: 7.32; 1.79-29.8; 16.9, 5.60-50.8; 2.47, 1.17-5.18; 5.79, 2.66-12.6; 2.71, 1.07-6.91; and 3.39, 1.47-7.83, respectively. On the other hand, more consumption of fruit, fluid intake and better lifestyle (physical activity) significantly reduced the risk of developing prostate cancer with odd ratios and corresponding 95% confidence intervals of: 0.27, 0.11-0.61; 0.05, 0.02-0.12; and 0.28, 0.13-0.58. Conclusions: The results of the present study suggested that age, family history of prostate cancer, smoking, obesity, fluid intake, frequent use of fat items, consumption of fruits and better lifestyle might be associated with prostate cancer among Pakistani males.

RHadoop 플랫폼기반 CAWFP-Tree를 이용한 적응 빈발 패턴 알고리즘 (Adaptive Frequent Pattern Algorithm using CAWFP-Tree based on RHadoop Platform)

  • 박인규
    • 디지털융복합연구
    • /
    • 제15권6호
    • /
    • pp.229-236
    • /
    • 2017
  • 효율적인 빈발 패턴 알고리즘은 연관 규칙 마이닝이나 융복합을 위한 마이닝 과정에서 필수적인 요소이며 많은 활용성을 가지고 있다. 패턴 마이닝을 위한 많은 모델들이 빈발 패턴에 관한 정보를 추출하여 FP-트리를 이용하여 저장하고 있다. 본 논문에서는 항목들의 무게중심을 이용한 새로운 빈발 패턴 알고리즘(CAWFP-Growth)을 제안하여 항목들이 가지는 가중치와 빈도수를 같이 고려하여 항목간의 중심을 계산하여 기존의 FP-Growth 알고리즘의 효율성을 향상시킨다. 제안한 방법은 하향 폐쇄의 성질을 유지하기 위한 기존의 전역적 최대치 가중치 지지도를 필요로 하지 않기 때문에 자연히 빈발 패턴의 탐색시간이 줄어들고 정보의 손실을 줄일 수 있다. 실험결과를 통하여 제안된 알고리즘이 기존의 동적가중치를 이용하는 다른 방법과 비교해볼 때, 항목들의 무게중심이 빈발패턴의 정확한 정보를 유지하고 FP-트리의 처리시간을 줄여주기 때문에 제안한 방법의 중요성을 보이고 있다 또한 가상 분산모드에서 맵리듀스 프레임을 기반으로 빅데이터를 모델링하고 향후 완전분산 모드에서 제안한 알고리즘의 모델링이 필요하다.

Portion sizes of foods frequently consumed by the Korean elderly: Data from KNHANES IV-2

  • Kim, Sook-Bae;Kim, Soon-Kyung;Kim, Se-Na;Kim, So-Young;Cho, Young-Sook;Kim, Mi-Hyun
    • Nutrition Research and Practice
    • /
    • 제5권6호
    • /
    • pp.553-559
    • /
    • 2011
  • The purpose of this study was to define a one-portion size of food frequently consumed by the Koreans aged 65 years or over. From the original 8,631 people who took part in the Forth Korea National Health and Nutrition Examination Survey(KNHANES IV-2) 2008, we analyzed the data on 1,458 persons (16.9%) aged 65 and over, and selected food items consumed based on the intake frequency of 30 or more by all participant. A total of 158 varieties of food items were selected. The portion size of food items was set on the basis of the median amount (50 percentile) in a single intake by a single person. In the cereals category, 13 items were selected, of which the most frequently consumed item was well-polished rice with portion size of 75 g. Among legumes, 7 items were selected, of which the most frequent item was dried black soybean with a portion size of 6 g. Among the 16 groups, the most varied food group (49 items) was vegetables, and among these the most frequently occurring item was garlic (5 g), while among the fruit group, only 11 items were selected, as their intake frequency was low. Fish and shellfish were more frequently consumed by the elderly than meats. The most frequently consumed meat was pork loin, with a portion size of 30 g. In fish and shellfish, the most frequently consumed item was dried and boiled large anchovy with a portion size of 2 g. Portion sizes for food items consumed regularly by the elderly may be conveniently and effectively used in dietary planning and in nutritional education programs, and in assessing the diet intake status of the elderly.