초록
공공데이터는 공공기관이 만들어내는 자료나 정보를 국민에게 공개한 것이다. 정부는 공공데이터포털과 개별기관의 웹사이트를 통해 공공데이터를 개방하고 있다. 그러나 데이터 사용자 관점에서 원하는 공공데이터를 탐색하고 활용하는데 제약이 있는 것이 현실이다. 특히, 데이터 목록의 특성을 파악하고 서로 다른 데이터를 연계하는 과정에 많은 노력과 시간이 필요하다. 본 연구는 공공데이터로 개방된 데이터 목록이 갖고 있는 항목명의 공통 관계를 분석하여 데이터 목록사이의 연결 가능성을 제안한다. 공공데이터포털에서 제공하는 데이터 목록을 수집하고, 데이터 목록에 포함된 데이터 항목명을 추출한다. 추출된 항목명은 형식 개념 분석을 통해 형식 문맥 (formal context)과 형식 개념 (formal concept)으로 구성된다. 형식 개념은 데이터 목록과 항목명을 각각 외연과 내연으로 갖고 있고, 내연의 공통항목을 분석해 데이터 연결 가능성을 판별한다. 형식 개념 분석을 통해 도출한 결과는 데이터 목록의 의미적 연결에 효과적으로 활용될 수 있고, 공공데이터 개방을 위한 데이터 표준 및 품질개선에 적용할 수 있다.
Public open data is a database or electronic file produced by a public agency or government. The government is opening public data through the open data portals and individual agency websites. However, it is a reality that there is a limit to search and utilize desired public data from the perspective of data users. In particular, it takes a great deal of effort and time to understand the characteristics of data sets and to combine different data sets. This study suggests the possibility of interlinking between data sets by analyzing the common relationship of item names held by public data. The data sets are collected from the open data portal, and item names included in the data sets are extracted. The extracted item names consist of formal context and formal concept through formal concept analysis. The format concept has a list of data sets and a set of item name as extent and intent, respectively, and analyzes the common items of intent end to determine the possibility of data connection. The results derived from the formal concept analysis can be effectively applied to the semantic connection of the public data, and can be applied to data standard and quality improvement for public data release.