• 제목/요약/키워드: Visual feature

검색결과 742건 처리시간 0.024초

Generating Radiology Reports via Multi-feature Optimization Transformer

  • Rui Wang;Rong Hua
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제17권10호
    • /
    • pp.2768-2787
    • /
    • 2023
  • As an important research direction of the application of computer science in the medical field, the automatic generation technology of radiology report has attracted wide attention in the academic community. Because the proportion of normal regions in radiology images is much larger than that of abnormal regions, words describing diseases are often masked by other words, resulting in significant feature loss during the calculation process, which affects the quality of generated reports. In addition, the huge difference between visual features and semantic features causes traditional multi-modal fusion method to fail to generate long narrative structures consisting of multiple sentences, which are required for medical reports. To address these challenges, we propose a multi-feature optimization Transformer (MFOT) for generating radiology reports. In detail, a multi-dimensional mapping attention (MDMA) module is designed to encode the visual grid features from different dimensions to reduce the loss of primary features in the encoding process; a feature pre-fusion (FP) module is constructed to enhance the interaction ability between multi-modal features, so as to generate a reasonably structured radiology report; a detail enhanced attention (DEA) module is proposed to enhance the extraction and utilization of key features and reduce the loss of key features. In conclusion, we evaluate the performance of our proposed model against prevailing mainstream models by utilizing widely-recognized radiology report datasets, namely IU X-Ray and MIMIC-CXR. The experimental outcomes demonstrate that our model achieves SOTA performance on both datasets, compared with the base model, the average improvement of six key indicators is 19.9% and 18.0% respectively. These findings substantiate the efficacy of our model in the domain of automated radiology report generation.

스포츠 매장의 전회에 따른 정보 탐색과 시각적 이해 특성 - 원-공간과 전회-공간의 이미지 비교를 통해 - (Searching of Information on Reverse left/right Space in Sports-Shop and Features of Its Visual Appreciation - Through Comparison of Original and Reverse left/right Image Space -)

  • 김종하
    • 한국실내디자인학회논문집
    • /
    • 제25권5호
    • /
    • pp.71-81
    • /
    • 2016
  • This research has been carried out with the objects of sporting goods shops to find out what structure of those shops raises more interest from customers. The tracking eyes on the objects which are the same but seen to have different structures has revealed the followings. Customers' visual appreciation of Reverse left/right Images (11.1) was found to be higher than that of Original Images (10.6). Furthermore, the reverse left/right image of the space also was found to attract more interest from customers, which led them to have longer observation. The below is about the interpretation of the spatial exploration by observation time and the appreciation of its visual content in line with the experiment objects of selling spaces. The longer the space was observed, (1)the higher the expansive searching of space was, (2)the more spots were observed as if they did not know what to see after they first observed at early hours, (3)later (in the time range of 64~73 seconds) they came to look at the spots in which they got interested, (4)and then again they suddenly got lost what to see. When the change of observation characteristics by time range is reviewed, it can be seen that the searching of original images is changed from Divergent Feature to Convergent Feature when the observation time increases from the early stage of observation to the later. On the contrary, the reverse left/right images were found to have the opposite searching features, that is, from convergent exploration to divergent exploration. These findings show that the reverse left/right images of the sporting goods shops, which were the experiment objects, have more factors attracting customers' attention and interest and that it is the very shop-structure which makes customers have better visual appreciation of those shops.

시.공간특징에 대해 적응할 수 있는 ROI 탐지 시스템 (An Adaptive ROI Detection System for Spatiotemporal Features)

  • 박민철;최경주
    • 한국콘텐츠학회논문지
    • /
    • 제6권1호
    • /
    • pp.41-53
    • /
    • 2006
  • 본 논문에서는 동영상에서 시간과 공간특징을 선택적으로 사용한 ROI(Region of Interest) 탐지 시스템을 소개한다. 동영상에서 명암도, 색상 등과 같은 공간특징을 사용한 공간상의 현저도 뿐만 아니라 시간상의 현저도도 얻기 위하여 모션이라는 시간특징을 사용하였다. 본 시스템에서는 동영상이 입력되면 공간특징 및 시간특징을 탐지하고, 이 특징과 관련된 기존의 심리학적 연구결과를 바탕으로 이들을 분석한다. 이렇게 분석된 결과는 하나로 통합되어 이를 기반으로 ROI 영역을 탐지한다. 일반적으로 비디오 영상에서 움직이는 개체나 영역은 같은 영상 안의 다른 개체나 영역보다 먼저 주의가 가게 되므로, 본 시스템에서는 분석된 결과를 통합하는 데 있어 시간특징인 모션을 공간특징보다 우선하여 통합한다. 시스템의 성능 분석을 위하여 동일한 실험영상을 가지고 인간을 대상으로 한 심리학적 실험을 우선 수행하였으며, 이 결과를 기준으로 본 시스템에서 얻어진 결과를 비교하여 모형의 성능을 분석하였다. 실험결과 공간특징만을 사용했을 때 보다 시간특징을 같이 사용함으로써 시스템의 성능을 보다 향상시킬 수 있었다.

  • PDF

아이트래킹을 활용한 개인 게임방송 실시간 댓글의 시각적 주의에 관한 연구: 모바일 플랫폼을 중심으로 (A Study on the Visual Attention of Game Broadcast Real-time Review Using Eye Tracking: Focusing on Mobile Platform)

  • 은석함;왕김남;황미경;이상호
    • 디지털융복합연구
    • /
    • 제20권5호
    • /
    • pp.733-739
    • /
    • 2022
  • 본고는 사전 설문지를 통해 소비자의 실시간 댓글에 대한 기능성 수요, 수용 정도 및 선호도를 조사한 뒤 아이트래킹을 통해 실시간 댓글의 유형 및 구역 위치에 대해 비교분석을 진행하는 연구이다. 연구 결과에 따르면, 실시간 댓글의 기능성 수요가 비교적 높고, 수용 정도가 비교적 높으며, 실시간 댓글의 기능은 이용자 선호도에 영향을 미치지 않는 것으로 나타났다. 실시간 댓글 유형 중에 문장 하나를 별도의 반투명 사각형으로 했을 경우 스타일의 시각주의도가 가장 높게 나타났다. 이는 이용자의 시각 행동에 독특한 스타일의 경향성이 있음을 의미한다. 본 연구는 실시간 댓글 중 다양한 유형과 구역 위치의 시각적 주의도를 분석하는 것을 통하여 추후 실시간 댓글의 인터페이스 디자인에 선도적 역할을 할 수 있을 것으로 기대한다.

Improved Feature Selection Techniques for Image Retrieval based on Metaheuristic Optimization

  • Johari, Punit Kumar;Gupta, Rajendra Kumar
    • International Journal of Computer Science & Network Security
    • /
    • 제21권1호
    • /
    • pp.40-48
    • /
    • 2021
  • Content-Based Image Retrieval (CBIR) system plays a vital role to retrieve the relevant images as per the user perception from the huge database is a challenging task. Images are represented is to employ a combination of low-level features as per their visual content to form a feature vector. To reduce the search time of a large database while retrieving images, a novel image retrieval technique based on feature dimensionality reduction is being proposed with the exploit of metaheuristic optimization techniques based on Genetic Algorithm (GA), Extended Binary Cuckoo Search (EBCS) and Whale Optimization Algorithm (WOA). Each image in the database is indexed using a feature vector comprising of fuzzified based color histogram descriptor for color and Median binary pattern were derived in the color space from HSI for texture feature variants respectively. Finally, results are being compared in terms of Precision, Recall, F-measure, Accuracy, and error rate with benchmark classification algorithms (Linear discriminant analysis, CatBoost, Extra Trees, Random Forest, Naive Bayes, light gradient boosting, Extreme gradient boosting, k-NN, and Ridge) to validate the efficiency of the proposed approach. Finally, a ranking of the techniques using TOPSIS has been considered choosing the best feature selection technique based on different model parameters.

한국어 모음 입술독해를 위한 시공간적 특징에 관한 연구 (A Study on Spatio-temporal Features for Korean Vowel Lipreading)

  • 오현화;김인철;김동수;진성일
    • 한국음향학회지
    • /
    • 제21권1호
    • /
    • pp.19-26
    • /
    • 2002
  • 본 논문에서는 한국어 입술독해를 위한 기반 연구로서 음성학에 기반하여 음성의 시각적 기본 단위인 viseme을 정의하고 입술의 움직임을 적절히 표현할 수 있는 특징들을 추출하여 그 성능을 분석하였다. 먼저, 다수의 화자로부터 한국어 모음에 해당하는 입술의 동영상 데이터베이스를 획득하고 각모음별 시각적 특성을 분석하여 7개의 한국어 모음 viseme을 정의하였으며 입술 윤곽선상의 특징점과 시공간적 특징 벡터들을 추출하여 은닉 마르코프 모델에 적용함으로써 효과적인 입술독해를 위한 각 특징 벡터별 성능을 비교하였다. 7개의 한국어 각 viseme에 대한 인식 실험 결과에서 입술의 안팎 윤곽선의 정보가 모두 반영된 특징 벡터가 입술독해에 효과적으로 적용될 수 있으며 윤곽선 상의 특징점들의 시간적 움직임 크기와 방향이 입술독해를 위하여 매우 중요한 요소임을 확인할 수 있었다.

Utilizing Context of Object Regions for Robust Visual Tracking

  • Janghoon Choi
    • 한국컴퓨터정보학회논문지
    • /
    • 제29권2호
    • /
    • pp.79-86
    • /
    • 2024
  • 본 논문에서는 단일 영역 정보만을 활용하는 기존의 방법론을 개선하기 위해, 물체의 맥락영역에 대한 정보를 함께 물체 추적에 활용하는 새로운 기법을 제시한다. 기존의 방법론들은 모든 후보 영역들을 독립적으로 처리하는 구조로, 비슷한 외양의 영역들이 등장하는 경우 이를 성공적으로 구분하지 못하는 문제점을 보여주었다. 이는 주어진 장면 내에 등장하는 모든 후보 물체 영역들에 대한 맥락 정보를 고려하지 못하여 생기는 문제이다. 제안하는 방법론에서는 비슷한 외양의 영역들 간의 특징점 정보 교환을 보조하고 이들 간의 구별성을 높이는 것을 목표로 하였다. 이를 구현하기 위해 MLP-믹서 (MLP-Mixer) 모델을 활용하여 맥락영역 간의 정보 교환을 모델링하는 모듈을 제시하였다. 이를 통해 구현된 특징점 채널별, 영역간의 상호작용 연산은 영역의 개별 특징점 표현에 대해 장면 맥락 정보가 내장될 수 있도록 보조한다. 제안한 방법론의 성능을 평가하기 위해 대규모 물체 추적 데이터셋인 LaSOT을 사용하였고, 성능 평가 결과 제안한 알고리즘은 AUC 지표 기준 0.560의 높은 성능과 함께 65fps의 실시간 속도로 동작함을 확인하였다.

인간친화형 인터페이스를 위한 사용자 얼굴에서의 효과적인 의도 파악 (An Effective Intention Reading from User Face for Human-Friendly Interface)

  • 김대진;송원경;김종성;변증남
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2000년도 추계종합학술대회 논문집(3)
    • /
    • pp.25-28
    • /
    • 2000
  • In this paper, an effective intention reading scheme is proposed for human-friendly interface. Soft computing techniques such as fuzzy logic and artificial neural networks are used for this. And Gabor filter based feature(GG feature) is also proposed to deal with local activity in the human face. It is based on human visual system and Gabor filter based approach is very popular in these days. The proposed scheme is adopted for human-friendly interface for rehabilitation service robotic system KARES II.

  • PDF

심볼로지 패턴의 특징 정보를 이용한 자동 시각 검사시스템 개발 (Development of an Automatic Visual Inspection System Using Simbology Patterns)

  • 황정목;장동식
    • 산업공학
    • /
    • 제10권3호
    • /
    • pp.133-143
    • /
    • 1997
  • In this paper, an improved method is developed for automatic inspection system using simbology patterns. The developed method uses the two previously developed matching methods the template maching method and the feature matching method. The template matching method is very sensitive to variations of target images such as translation and rotation of objects. On the other hand, the feature matching method doesn't extract proper features in some types of symbology patterns. The proposed method shows the improvement of precision in recognition of defects and flexibility of different types of symbology patterns.

  • PDF

GPU 가속화를 통한 이미지 특징점 기반 RGB-D 3차원 SLAM (Image Feature-Based Real-Time RGB-D 3D SLAM with GPU Acceleration)

  • 이동화;김형진;명현
    • 제어로봇시스템학회논문지
    • /
    • 제19권5호
    • /
    • pp.457-461
    • /
    • 2013
  • This paper proposes an image feature-based real-time RGB-D (Red-Green-Blue Depth) 3D SLAM (Simultaneous Localization and Mapping) system. RGB-D data from Kinect style sensors contain a 2D image and per-pixel depth information. 6-DOF (Degree-of-Freedom) visual odometry is obtained through the 3D-RANSAC (RANdom SAmple Consensus) algorithm with 2D image features and depth data. For speed up extraction of features, parallel computation is performed with GPU acceleration. After a feature manager detects a loop closure, a graph-based SLAM algorithm optimizes trajectory of the sensor and builds a 3D point cloud based map.