• 제목/요약/키워드: 패턴셋

검색결과 114건 처리시간 0.022초

웹 말뭉치에 대한 문장 필터링 데이터 셋 구축 방법 (Sentence Filtering Dataset Construction Method about Web Corpus)

  • 남충현;장경식
    • 한국정보통신학회논문지
    • /
    • 제25권11호
    • /
    • pp.1505-1511
    • /
    • 2021
  • 자연어 처리 분야 내 다양한 작업들에서 높은 성능을 보인 사전 학습된 모델은 대량의 말뭉치를 이용하여 문장들의 언어학적 패턴을 스스로 학습함으로써 입력 문장 내 각 토큰들을 적절한 특징 벡터로 표현할 수 있다는 장점을 갖고 있다. 이러한 사전 학습된 모델의 학습에 필요한 말뭉치를 구축하는 방법 중 웹 크롤러를 이용하여 수집한 경우 웹사이트에 존재하는 문장은 다양한 패턴을 갖고 있기 때문에 문장의 일부 또는 전체에 불필요한 단어가 포함되어 있을 수 있다. 본 논문에서는 웹으로부터 수집한 말뭉치에 대해 신경망 모델을 이용하여 불필요한 단어가 포함된 문장을 필터링하기 위한 데이터 셋 구축 방법에 대해 제안한다. 그 결과, 총 2,330개의 문장을 포함한 데이터 셋을 구축하였다. 또한 신경망 모델을 이용하여 구축한 데이터 셋을 학습시켜 성능을 평가하였으며, BERT 모델이 평가 데이터에 대해 93.75%의 정확도로 가장 높은 성능을 보였다.

CodeBERT 모델의 전이 학습 기반 코드 공통 취약점 탐색 (Detecting Common Weakness Enumeration(CWE) Based on the Transfer Learning of CodeBERT Model)

  • 박찬솔;문소영;김영철
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제12권10호
    • /
    • pp.431-436
    • /
    • 2023
  • 소프트웨어 공학 영역에 인공지능의 접목은 큰 화두 중 하나이다. 전 세계적으로 1) 인공지능을 통한 소프트웨어 공학, 2) 소프트웨어 공학을 통한 인공지능 두 가지 방향으로 활발히 연구되고 있다. 그 중 소프트웨어 공학에 인공지능을 접목하여 나쁜 코드 영역을 식별하고 해당 부분을 리팩토링하는 연구가 진행되고 있다. 해당 연구에서 인공지능이 나쁜 코드 요소의 패턴을 잘 학습하기 위해서는 학습하려는 나쁜 코드 요소가 라벨링 된 데이터셋이 필요하다. 문제는 데이터셋이 부족할뿐더러, 자체적으로 수집한 데이터셋의 정확도는 신뢰할 수 없다. 이를 해결하기 위해 코드 데이터 수집 시 전체 코드가 아닌 높은 복잡도를 가진 코드 모듈 영역을 대상으로만 나쁜 코드 데이터를 수집한다. 이후 수집한 데이터셋을 CodeBERT 모델의 전이 학습하여 코드 공통 취약점을 탐색하는 방법을 제안한다. 해당 데이터셋을 통해 CodeBERT 모델이 코드의 공통 취약점 패턴을 더 잘 학습할 수 있다. 이를 통해 전통적인 방법보다 인공지능 모델을 이용해 코드를 분석하고 공통 취약점 패턴을 더 정확하게 식별할 수 있을 것으로 기대한다.

지상파 DMB 수신 칩 설계 기술 동향 (Technical Trend of Terrestrial-DMB Receiver Chip Design)

  • 이주현;구본태;김성도;엄낙웅
    • 전자통신동향분석
    • /
    • 제20권6호통권96호
    • /
    • pp.1-14
    • /
    • 2005
  • DMB는 이동중에도 고품질 멀티미디어 방송의 시청을 가능하게 하는 새로운 디지털방송 규격으로 우리나라에서는 IT839 전략의 신 성장 산업인 디지털 TV와 함께 ‘8대서비스’ 품목에 포함되어 차세대 성장 엔진 사업으로 선정되었고 2005년 상반기에ETSI 표준으로 제정되었으며 2005년 12월 본 방송을 실시함으로써 세계 최초로 지상파 DMB 방송 시대를 눈앞에 두고 있다. 지상파 DMB 방송은 실시간 전자 상거래, 교육프로그램, 데이터 방송 서비스, TV 쇼핑, 재난 방송 등 그 활용 분야가 무궁무진하여 미래 생활의 패턴을 변화시킬 것으로 생각되고 있다. 한편 DMB 방송은 세계적으로는 유럽 노키아사의 ‘DVB-H’, 일본의 MBCo의 ‘위성 DMB’, 미국 Qualcomm사의‘MediaFLO’와 함께 세계 시장에서 경쟁하고 있다. 지상파 DMB 방송 수신을 위한 제품들은 전용 단말기 혹은 핸드폰, PDA 등에 장착되어 사용자에게 다가갈 것으로 예상되고 있으며 이를 위한 수신 칩 셋 개발 노력이 뜨겁게 이루어지고 있다. 본 고에서는 지상파 DMB를 위한 칩 셋 기술과 칩 셋 개발 동향에 대해 살펴 보고자 한다.

상대적 가중치 자질을 반영한 CRF 기반의 개체명 인식 (Named Entity Recognition based on CRF reflecting relative weight)

  • 정진욱
    • 한국어정보학회:학술대회논문집
    • /
    • 한국어정보학회 2017년도 제29회 한글및한국어정보처리학술대회
    • /
    • pp.338-339
    • /
    • 2017
  • 본 논문은 개체명 인식을 위해 CRF 모델을 이용해 분류를 수행했다. 개체명 후보를 개체명으로 식별에서 중의성 문제가 필요하다. 본 논문에서는 이러한 중의성 문제 해결을 위해 학습 셋으로부터 패턴과 형태적 특성을 고려해 개체명 후보를 최대로 선택하고 선택된 개체명 후보의 중의성과 정확도를 높이기 위해 주변의 문맥 자질과 분별 확률 모델인 CRF를 이용해 중의성 문제를 해결한다.

  • PDF

MEC 기반 비디오 캐시 시나리오를 위한 시계열 사용자 요청 패턴 데이터 세트 분석 (Analysis of time-series user request pattern dataset for MEC-based video caching scenario)

  • 왈리드 아크바르;아팍 모하마드;송왕철
    • KNOM Review
    • /
    • 제24권1호
    • /
    • pp.20-28
    • /
    • 2021
  • 소셜 미디어 애플리케이션 및 모바일 장치의 광범위한 사용으로 인해 데이터 트래픽이 지속해서 증가하고 있다. 소셜 미디어 애플리케이션은 끝없이 많은 양의 멀티미디어 트래픽, 특히 비디오 트래픽을 생성하고 있다. YouTube, Daily Motion 및 Netflix와 같은 많은 소셜 미디어 플랫폼이 생성하는 것이다. 이러한 플랫폼에서는 다른 비디오와 비교하여 몇 개의 인기 비디오가 여러 번 요청된다. 이러한 인기 있는 비디오는 지속적인 사용자 요구 사항을 충족하기 위해 사용자 주변에 캐시해야 한다. MEC는 일관된 사용자 요구와 사용자 근접 캐시를 위한 필수 패러다임으로 부상했다. 시간에 따라 사용자 요구 패턴이 어떻게 달라지는지를 이해하는 것이 과제이다. 본 논문은 공개 데이터셋인 MovieLens 20M, MovieLens 100K, The Movies Dataset 3개를 분석하여 시간에 따른 사용자 요청 패턴을 찾는다. 모든 데이터셋의 시간별, 일별, 월별 및 연간 추세를 확인할 수 있다. MEC 기반 비디오 캐시 시나리오에서 사용자 요청 패턴을 분석 및 생성함으로써, 많은 연구에서 사용될 수 있을 것이다.

마우스 동작 기록 기반 비정상 게임 이용자 감지를 위한 단일 클래스 분류 기법 (One-Class Classification based on Recorded Mouse Activity for Detecting Abnormal Game Users)

  • 송민준;김인기;김범준;전영훈;곽정환
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2023년도 제67차 동계학술대회논문집 31권1호
    • /
    • pp.39-42
    • /
    • 2023
  • 최근 온라인 게임 산업이 급속도로 확장됨과 더불어 Gamebot과 같은 비정상적인 프로그램으로 인한 게임 서비스 피해사례가 급격하게 증가하고 있다. 특히, 대표적인 게임 장르 중 하나인 FPS(First-Person Shooter)에서 Aimbot의 사용은 정상적인 이용자들에게 재미 요소를 잃어버리게 하고 상대적 박탈감을 일으켜 게임의 수명을 줄이는 원인이 된다. 비정상 게임 이용자의 근절을 위해서 메모리 변조 및 불법 변조 프로그램 접근 차단 기법과 불법 프로그램 사용의 패턴 모니터링과 같은 기법들이 제안되었지만, 우회 프로그램 및 새로운 패턴을 이용한 비정상적인 프로그램의 개발에는 취약하다는 단점이 있다. 따라서, 본 논문에서는 정상적인 게임 이용자의 패턴만 학습함으로써 비정상 이용자 검출을 가능하게 하는 딥러닝 기반 단일 클래스 분류 기법을 제안하며, 가장 빈번하게 발생하는 치트(Cheat) 유형인 FPS 게임 내 Aimbot 사용 감지에 초점을 두었다. 제안된 비정상 게임 이용자 감지 시스템은 정상적인 사용자의 마우스 좌표를 데카르트 좌표계(Cartesian coordinates)와 극좌표계(Polar coordinates)의 형태로 패턴을 추출하는 과정과 정상적인 마우스 동작 기록으로 부터 학습된 LSTM 기반 Autoencoder의 복원 에러에 따른 검출 과정으로 구성된다. 실험에서 제안된 모델은 FPS 게임 내 마우스 동작을 기록한 공개 데이터셋인 CSGO 게임 데이터셋으로 부터 학습되었으며, 학습된 모델의 테스트 결과는 데카르트 좌표계로부터 훈련된 제안 모델이 비정상 게임 이용자를 분류하는데 적합함을 입증하였다.

  • PDF

스마트폰 사용패턴 분석을 위한 원격 로그데이터 수집 시스템 구현 (Implementation of a remote log-data collecting system for the analysis on smartphone usage pattern)

  • 송현지;이민경;정희원;유석종
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2014년도 춘계학술발표대회
    • /
    • pp.237-239
    • /
    • 2014
  • 다수 사용자의 스마트폰 사용패턴을 협업적인 방법으로 분석할 경우 모바일 기기에 대한 선호도 분석, 과몰입 정도 판단 등 다양한 관련 연구에 활용될 수 있다. 본 연구는 스마트폰의 사용패턴 분석을 통한 사용자 맞춤형 서비스 개발을 위하여 로그데이터를 추출하여 서버에 저장하는 시스템을 설계하고 구현하는 것을 목표로 한다. 사용자의 스마트 폰 로그데이터를 수집하기 위하여 모바일앱을 개발하고 모바일앱을 통해서 추출된 로그데이터를 저장할 서버 DB 를 구축하고 유사성 분석을 위한 협업필터링 엔진을 개발하였다. 개발된 시스템의 성능 평가를 위하여 일부 사용자에 대한 사용패턴 데이터셋 구축 실험을 수행하였으며 후속 연구를 위한 실험 환경을 설계하였다.

이동데이터 시간분석을 통한 이동양태 파악 (Investigating Cyclic Pattern of Mobility through Analysis of Geopositioning Data)

  • 홍수찬;송하윤
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2019년도 춘계학술발표대회
    • /
    • pp.723-726
    • /
    • 2019
  • 사람은 한 장소를 방문할 때 순환 패턴이 있으며, 이 패턴에 여러 싸이클의 경향이 있다. 요즘은 스마트폰 및 기타 휴대용 장치로 개인 이동성 데이터를 수집하는 것이 가능하다. 이러한 장치는 다양한 위치 데이터를 수집하고 여러가지 방법으로 분석할 수 있게 해준다. 위치 수집기를 기반으로 지구 위치 데이터에서 추출된 사람의 이동성 모델을 수립하고, 위치 클러스터를 방문자의 순환 패턴을 조사할 수 있다. 수년 동안 수집된 개인의 이동성 모델을 토대로 클러스터 재방문 시간을 계산 후 분석하여 그래프로 시각화하였다. 시간 순서의 위치 클러스터와 방문 클러스터에 대한 위치 데이터는 1 분 단위로 측정된다. 전체 데이터 방문 횟수는 15 분마다 정규화하고, 자원 봉사자의 다양한 지리적 위치 데이터 셋에 대해 방문의 순환 패턴은 자기 상관, 자기 공분산 및 재방문 시간으로 살펴볼 수 있다.

국내 시판 코르셋 룩의 패턴 및 구성 실태분석 (An Analysis of the Pattern and Formation of Corset Look on the Domestic Market)

  • 정현정;나수임
    • 패션비즈니스
    • /
    • 제14권5호
    • /
    • pp.66-77
    • /
    • 2010
  • This study aimed at examining the pattern and detailed formation of corset look which has established itself as a sort of fashion look as people began to wear underwear as part of outer garment. The study tried to present basic materials helpful for developing and creating the design and pattern of corset look. First, the collected corset look of each brand was copied and then developed. According to the result, corset look's representative silhouette turned out to be hourglass silhouette that tightened up the waist with an emphasis on expressing the beauty of the body. However, unlike corsets of the past, corsets today are being created with focus on the design rather than using lots of incision lines. Second, The bust girth of corset look items turned out to have little function to compress and deform the body like the corset of the past that was far smaller than the body. In addition, the corset style that used the lines of corset alone as motive turned out to have the larger waist girth. Third, the dismantling of collected corset look showed that the materials and formation features of corset look have become simple and that the simplification of corset look has made the items of corset look everyday clothes which can be worn practically and universally.

기계독해 시스템에서 답변 불가능 문제 해결을 위한 독해 패턴 모방 방법 (Machine Reading Comprehension System to Solve Unanswerable Problems using Method of Mimicking Reading Comprehension Patterns)

  • 이예진;장영진;이현구;신동욱;박찬훈;강인호;김학수
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2021년도 제33회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.139-143
    • /
    • 2021
  • 최근 대용량 말뭉치를 기반으로 한 언어 모델이 개발됨에 따라 다양한 자연어처리 분야에서 사람보다 높은 성능을 보이는 시스템이 제안되었다. 이에 따라, 더 어렵고 복잡한 문제를 해결하기 위한 데이터셋들이 공개되었으며 대표적으로 기계독해 작업에서는 시스템이 질문에 대해 답변할 수 없다고 판단할 수 있는지 평가하기 위한 데이터셋이 공개되었다. 입력 받은 데이터에 대해 답변할 수 없다고 판단하는 것은 실제 애플리케이션에서 중요한 문제이기 때문에, 이를 해결하기 위한 연구도 다양하게 진행되었다. 본 논문에서는 문서를 이해하여 답변할 수 없는 데이터에 대해 효과적으로 판단할 수 있는 기계독해 시스템을 제안한다. 제안 모델은 문서의 내용과 질문에 대한 이해도가 낮을 경우 정확한 정답을 맞히지 못하는 사람의 독해 패턴에서 착안하여 기계독해 시스템의 문서 이해도를 높이고자 한다. KLUE-MRC 개발 데이터를 통한 실험에서 EM, Rouge-w 기준으로 각각 71.73%, 76.80%을 보였다.

  • PDF