• 제목/요약/키워드: VGG

검색결과 182건 처리시간 0.021초

GPR B-scan 회색조 이미지의 싱크홀 특성추출 최적 컨볼루션 신경망 백본 연구 (A Study on the Optimal Convolution Neural Network Backbone for Sinkhole Feature Extraction of GPR B-scan Grayscale Images)

  • 박영훈
    • 대한토목학회논문집
    • /
    • 제44권3호
    • /
    • pp.385-396
    • /
    • 2024
  • GPR을 활용한 싱크홀 감지 정확도 강화를 위하여 본 연구에서는 GPR B-scan 회색조 이미지의 싱크홀 특성을 최적으로 추출할 수 있는 컨볼루션 신경망을 도출하였다. 사전 훈련된 컨볼루션 신경망이 바닐라 컨볼루션 신경망보다 2배 이상의 효용성을 가지는 것으로 평가되었다. 사전 훈련된 컨볼루션 신경망에 있어서 빠른 특성 추출이 특성 추출보다 낮은 과대적합을 발생시키는 것으로 나타났다. 아키텍처 종류와 시뮬레이션 조건에 따라 top-1 검증 정확도 크기와 발생 조건 및 연산 시간이 상이한 것으로 분석되어, 사전 훈련된 컨볼루션 신경망 중 InceptionV3가 GPR B-scan 회색조 이미지의 싱크홀 감지에 가장 강건한 것으로 평가되었다. Top-1 검증 정확도와 아키텍처 효율 지수를 동시에 고려할 경우 VGG19와 VGG16가 GPR B-scan 회색조 이미지의 싱크홀 특성 추출 백본으로 높은 효율성을 가지는 것으로 분석되었으며, GPR 장비에 탑재하여 실시간으로 싱크홀 특성 추출을 할 경우에는 MobileNetV3-Large 백본이 적합한 것으로 나타났다.

Online to Offline 상점을 위한 한글 메뉴판 인식 : 어텐션 메커니즘을 적용한 VGG-ResNet 융합 모델 (Recognition of Korean Menu for Online to Offline Stores : VGG-ResNet Fusion Model with Attention Mechanism)

  • 시종욱;이상진;김성영
    • 한국정보전자통신기술학회논문지
    • /
    • 제17권4호
    • /
    • pp.190-197
    • /
    • 2024
  • O2O 상점 모델은 온/오프라인의 경계를 허물어 고객에게 큰 편의성을 제공하는 플랫폼이다. 이러한 플랫폼을 효과적으로 운영하기 위해서는 소상공인들이 필요한 정보를 디지털 형태로 제공해야 한다. 특히, 한글 메뉴판을 디지털화하는 과정이 수동으로 진행될 경우 여러 문제점을 일으킬 수 있으며, OCR 기술 사용 시 한글의 인식 정확도가 낮아 오류 인식의 가능성이 높다. 이에 본 논문에서는 한글 메뉴판의 자동 인식을 위해 대표적인 OCR 모델인 EasyOCR을 기반으로 하되, 한글 문자 인식의 낮은 정확도를 개선하고자 한다. 제안하는 모델은 VGG와 ResNet의 구조적 장점을 통합하고, 어텐션 메커니즘을 도입하여 한글 문자의 인식 성능을 크게 향상시키도록 설계한다. 실험 결과, 제안하는 모델은 EasyOCR에 비해 Accuracy 기준 약 3.5%, Confidence Score와 Normalized Edit Distance 기준 약 1%의 인식 정확도 향상을 보였다. 따라서, 제안한 방법이 기존 문제를 효과적으로 해결할 수 있음을 입증한다.

VGG16 과 U-Net 구조를 이용한 공력특성 예측 (Prediction of aerodynamics using VGG16 and U-Net)

  • 김보라;이승훈;장승현;황광일;윤민
    • 한국가시화정보학회지
    • /
    • 제20권3호
    • /
    • pp.109-116
    • /
    • 2022
  • The optimized design of airfoils is essential to increase the performance and efficiency of wind turbines. The aerodynamic characteristics of airfoils near the stall show large deviation from experiments and numerical simulations. Hence, it is needed to perform repetitive analysis of various shapes near the stall. To overcome this, the artificial intelligence is used and combined with numerical simulations. In this study, three types of airfoils are chosen, which are S809, S822 and SD7062 used in wind turbines. A convolutional neural network model is proposed in the combination of VGG16 and U-Net. Learning data are constructed by extracting pressure fields and aerodynamic characteristics through numerical analysis of 2D shape. Based on these data, the pressure field and lift coefficient of untrained airfoils are predicted. As a result, even in untrained airfoils, the pressure field is accurately predicted with an error of within 0.04%.

다양한 컨볼루션 신경망을 이용한 태국어 숫자 인식 (Handwriting Thai Digit Recognition Using Convolution Neural Networks)

  • ;정한민;김태홍
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2021년도 춘계학술대회
    • /
    • pp.15-17
    • /
    • 2021
  • 필기체 인식 연구는 주로 딥러닝 기술에 초점이 맞추어져 있으며, 최근 몇 년 동안 많은 발전을 이루었다. 특히, 필기체 태국어 숫자 인식은 태국 공식 문서와 영수증과 같은 숫자 정보를 포함한 많은 분야에서 중요한 연구 분야지만, 동시에 도전적인 분야이기도 하다. 대규모 태국어 숫자 데이터 집합의 부재를 해결하기 위해, 본 연구는 자체적인 데이터 집합을 구축하고 이를 다양한 컨볼루션 신경망으로 학습시켰다. 정확도 메트릭을 이용하여 평가한 결과, 배치 정규화 기반 VGG 13이 98.29%의 가장 높은 성능을 보였다.

  • PDF

기하학적 특징 추가를 통한 얼굴 감정 인식 성능 개선 (Improvement of Facial Emotion Recognition Performance through Addition of Geometric Features)

  • 정호영;한희일
    • 한국인터넷방송통신학회논문지
    • /
    • 제24권1호
    • /
    • pp.155-161
    • /
    • 2024
  • 본 논문에서는 기존의 CNN 기반 얼굴 감정 분석 모델에 랜드마크 정보를 특징 벡터로 추가하여 새로운 모델을 제안한다. CNN 기반 모델을 이용한 얼굴 감정 분류 연구는 다양한 방법으로 연구되고 있으나 인식률이 매우 저조한 편이다. 본 논문에서는 CNN 기반 모델의 성능을 향상시키기 위하여 CNN 모델에 ASM으로 구한 랜드마크 기반 완전 연결 네트워크를 결합함으로써 얼굴 표정 분류 정확도를 향상시키는 알고리즘을 제안한다. CNN 모델에 랜드마크를 포함시킴으로써 인식률이 VGG 0.9%, Inception 0.7% 개선되었으며, 랜드마크에 FACS 기반 액션 유닛 추가를 통하여 보다 VGG 0.5%, Inception 0.1%만큼 향상된 결과를 얻을 수 있음을 실험으로 확인하였다.

Accuracy Measurement of Image Processing-Based Artificial Intelligence Models

  • Jong-Hyun Lee;Sang-Hyun Lee
    • International journal of advanced smart convergence
    • /
    • 제13권1호
    • /
    • pp.212-220
    • /
    • 2024
  • When a typhoon or natural disaster occurs, a significant number of orchard fruits fall. This has a great impact on the income of farmers. In this paper, we introduce an AI-based method to enhance low-quality raw images. Specifically, we focus on apple images, which are being used as AI training data. In this paper, we utilize both a basic program and an artificial intelligence model to conduct a general image process that determines the number of apples in an apple tree image. Our objective is to evaluate high and low performance based on the close proximity of the result to the actual number. The artificial intelligence models utilized in this study include the Convolutional Neural Network (CNN), VGG16, and RandomForest models, as well as a model utilizing traditional image processing techniques. The study found that 49 red apple fruits out of a total of 87 were identified in the apple tree image, resulting in a 62% hit rate after the general image process. The VGG16 model identified 61, corresponding to 88%, while the RandomForest model identified 32, corresponding to 83%. The CNN model identified 54, resulting in a 95% confirmation rate. Therefore, we aim to select an artificial intelligence model with outstanding performance and use a real-time object separation method employing artificial function and image processing techniques to identify orchard fruits. This application can notably enhance the income and convenience of orchard farmers.

CT영상에서의 AlexNet과 VggNet을 이용한 간암 병변 분류 연구 (Malignant and Benign Classification of Liver Tumor in CT according to Data pre-processing and Deep running model)

  • 최보혜;김영재;최승준;김광기
    • 대한의용생체공학회:의공학회지
    • /
    • 제39권6호
    • /
    • pp.229-236
    • /
    • 2018
  • Liver cancer is one of the highest incidents in the world, and the mortality rate is the second most common disease after lung cancer. The purpose of this study is to evaluate the diagnostic ability of deep learning in the classification of malignant and benign tumors in CT images of patients with liver tumors. We also tried to identify the best data processing methods and deep learning models for classifying malignant and benign tumors in the liver. In this study, CT data were collected from 92 patients (benign liver tumors: 44, malignant liver tumors: 48) at the Gil Medical Center. The CT data of each patient were used for cross-sectional images of 3,024 liver tumors. In AlexNet and VggNet, the average of the overall accuracy at each image size was calculated: the average of the overall accuracy of the $200{\times}200$ image size is 69.58% (AlexNet), 69.4% (VggNet), $150{\times}150$ image size is 71.54%, 67%, $100{\times}100$ image size is 68.79%, 66.2%. In conclusion, the overall accuracy of each does not exceed 80%, so it does not have a high level of accuracy. In addition, the average accuracy in benign was 90.3% and the accuracy in malignant was 46.2%, which is a significant difference between benign and malignant. Also, the time it takes for AlexNet to learn is about 1.6 times faster than VggNet but statistically no different (p > 0.05). Since both models are less than 90% of the overall accuracy, more research and development are needed, such as learning the liver tumor data using a new model, or the process of pre-processing the data images in other methods. In the future, it will be useful to use specialists for image reading using deep learning.

딥러닝기반 건축폐기물 이미지 분류 시스템 비교 (A Comparison of Image Classification System for Building Waste Data based on Deep Learning)

  • 성재경;양민철;문경남;김용국
    • 한국인터넷방송통신학회논문지
    • /
    • 제23권3호
    • /
    • pp.199-206
    • /
    • 2023
  • 본 연구는 건축시 발생되는 폐기물의 자동분류를 위해 딥러닝 알고리즘을 활용해 건출 폐기물 데이터를 각각 목재 폐기물, 플라스틱 폐기물, 콘크리트 폐기물로 분류하는 두 모델들을 통해서 성능 비교를 한다. 건축 폐기물의 분류를 위해 사용된 딥러닝 알고리즘은 합성곱 신경망 이미지 분류 알고리즘 VGG-16과 NLP를 기반으로 이미지를 시퀀스화 시킨ViT, Vision Transformer 모델을 사용했다. 건축 폐기물 데이터 수집을 위해 이미지 데이터를 전 세계 검색엔진에서 크롤링 하였고, 육안으로도 명확히 구분하기 어렵거나, 중복되는 등 실험에 방해되는 이미지는 전부 제외하여 각 분류당 1천장씩 총 3천장의 이미지를 확보했다. 또한, 데이터 학습시에 모델의 정확도 향상에 도움을 주기 위해 데이터 확대 작업을 진행해 총 3만장의 이미지로 실험을 진행 하였다. 수집된 이미 데이터가 정형화 되어있지 않은 데이터 임에도 불구하고 실험 결과는 정확도가 VGG-16는 91.5%, ViT 는 92.7%의 결과가 나타났다. 이는 실제 건축폐기물 데이터 관리 작업에 실전 활용 가능성을 제시한 것으로 보인다. 본 연구를 바탕으로 추후에 객체 탐지 기법이나 의미론적 분할 기법까지 활용한다면, 하나의 이미지 안에서도 여러 세밀한 분류가 가능해 더욱 완벽한 분류가 가능할 것이다.

Effects of Hyper-parameters and Dataset on CNN Training

  • Nguyen, Huu Nhan;Lee, Chanho
    • 전기전자학회논문지
    • /
    • 제22권1호
    • /
    • pp.14-20
    • /
    • 2018
  • The purpose of training a convolutional neural network (CNN) is to obtain weight factors that give high classification accuracies. The initial values of hyper-parameters affect the training results, and it is important to train a CNN with a suitable hyper-parameter set of a learning rate, a batch size, the initialization of weight factors, and an optimizer. We investigate the effects of a single hyper-parameter while others are fixed in order to obtain a hyper-parameter set that gives higher classification accuracies and requires shorter training time using a proposed VGG-like CNN for training since the VGG is widely used. The CNN is trained for four datasets of CIFAR10, CIFAR100, GTSRB and DSDL-DB. The effects of the normalization and the data transformation for datasets are also investigated, and a training scheme using merged datasets is proposed.

A Deep Learning-Based Rate Control for HEVC Intra Coding

  • Marzuki, Ismail;Sim, Donggyu
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송∙미디어공학회 2019년도 추계학술대회
    • /
    • pp.180-181
    • /
    • 2019
  • This paper proposes a rate control algorithm for intra coding frame in HEVC encoder using a deep learning approach. The proposed algorithm is designed for CTU level bit allocation in intra frame by considering visual features spatially and temporally. Our features are generated using visual geometry group (VGG-16) with deep convolutional layers, then it is used for bit allocation per each CTU within an intra frame. According to our experiments, the proposed algorithm can achieve -2.04% Luma component BD-rate gain with minimal bit accuracy loss against the HM-16.20 rate control model.

  • PDF