통합 검색 | Korea Science

손을 다루는 컴퓨터 비전 작업들을 위한 멀티 모달 합성 데이터 생성 방법 (Generating A Synthetic Multimodal Dataset for Vision Tasks Involving Hands)

이창화;이선경;김동욱;정찬양;백승렬
- 한국정보처리학회:학술대회논문집
- /
- 한국정보처리학회 2020년도 추계학술발표대회
- /
- pp.1052-1055
- /
- 2020
본 논문에서는 3D 메시 정보, RGB-D 손 자세 및 2D/3D 손/세그먼트 마스크를 포함하여 인간의 손과 관련된 다양한 컴퓨터 비전 작업에 사용할 수 있는 새로운 다중 모달 합성 벤치마크를 제안 하였다. 생성된 데이터셋은 기존의 대규모 데이터셋인 BigHand2.2M 데이터셋과 변형 가능한 3D 손 메시(mesh) MANO 모델을 활용하여 다양한 손 포즈 변형을 다룬다. 첫째, 중복되는 손자세를 줄이기 위해 전략적으로 샘플링하는 방법을 이용하고 3D 메시 모델을 샘플링된 손에 피팅한다. 3D 메시의 모양 및 시점 파라미터를 탐색하여 인간 손 이미지의 자연스러운 가변성을 처리한다. 마지막으로, 다중 모달리티 데이터를 생성한다. 손 관절, 모양 및 관점의 데이터 공간을 기존 벤치마크의 데이터 공간과 비교한다. 이 과정을 통해 제안된 벤치마크가 이전 작업의 차이를 메우고 있음을 보여주고, 또한 네트워크 훈련 과정에서 제안된 데이터를 사용하여 RGB 기반 손 포즈 추정 실험을 하여 생성된 데이터가 양질의 질과 양을 가짐을 보여준다. 제안된 데이터가 RGB 기반 3D 손 포즈 추정 및 시맨틱 손 세그멘테이션과 같은 품질 좋은 큰 데이터셋이 부족하여 방해되었던 작업에 대한 발전을 가속화할 것으로 기대된다.
https://doi.org/10.3745/PKIPS.y2020m11a.1052 인용 PDF

디지털 컨버전스에서의 인터럽션: 멀티 모달리티와 멀티 태스킹 간의 상호 관계를 중심으로 (Interruption in Digital Convergence: Focused on Multi-Modality and Multi-Tasking)

이기호;정승기;김혜진;이인성;김진우
- 대한인간공학회지
- /
- 제26권3호
- /
- pp.67-80
- /
- 2007
Digital convergence, defined as the creative fusion of once-independent technologies and service, is getting more attention recently. Interruptions among internal functions happen frequently in digital convergence products because many functions that were in separate products are merged into a single product. Multi-tasking and multi-modality are two distinctive features of interruption in digital convergence products, but their impacts to the user have not been investigated yet. This study conducted a controlled experiment to investigate the impacts of multi-tasking and multi-modality on the subjective satisfaction and objective performance of digital convergent products. The study results indicate that multi-tasking and multi-modality have substantial effects individually as well as together. The paper ends with practical and theoretical implications of study results as well as research limits and future research.
https://doi.org/10.5143/JESK.2007.26.3.067 인용 PDF KSCI

멀티모달 인터랙션을 위한 사용자 병렬 모달리티 입력방식 및 입력 동기화 방법 설계 (Design of Parallel Input Pattern and Synchronization Method for Multimodal Interaction)

임미정;박범
- 대한인간공학회지
- /
- 제25권2호
- /
- pp.135-146
- /
- 2006
Multimodal interfaces are recognition-based technologies that interpret and encode hand gestures, eye-gaze, movement pattern, speech, physical location and other natural human behaviors. Modality is the type of communication channel used for interaction. It also covers the way an idea is expressed or perceived, or the manner in which an action is performed. Multimodal Interfaces are the technologies that constitute multimodal interaction processes which occur consciously or unconsciously while communicating between human and computer. So input/output forms of multimodal interfaces assume different aspects from existing ones. Moreover, different people show different cognitive styles and individual preferences play a role in the selection of one input mode over another. Therefore to develop an effective design of multimodal user interfaces, input/output structure need to be formulated through the research of human cognition. This paper analyzes the characteristics of each human modality and suggests combination types of modalities, dual-coding for formulating multimodal interaction. Then it designs multimodal language and input synchronization method according to the granularity of input synchronization. To effectively guide the development of next-generation multimodal interfaces, substantially cognitive modeling will be needed to understand the temporal and semantic relations between different modalities, their joint functionality, and their overall potential for supporting computation in different forms. This paper is expected that it can show multimodal interface designers how to organize and integrate human input modalities while interacting with multimodal interfaces.
https://doi.org/10.5143/JESK.2006.25.2.135 인용 PDF KSCI

한국어 발화 문장에 대한 비언어 표현 정보를 자동으로 생성하는 모델 (A Model to Automatically Generate Non-verbal Expression Information for Korean Utterance Sentence)

김재윤;장진예;김산;정민영;강현욱;신사임
- 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
- /
- 한국정보과학회언어공학연구회 2023년도 제35회 한글 및 한국어 정보처리 학술대회
- /
- pp.91-94
- /
- 2023
자연스러운 상호작용이 가능한 인공지능 에이전트를 개발하기 위해서는 언어적 표현뿐 아니라, 비언어적 표현 또한 고려되어야 한다. 본 논문에서는 한국어 발화문으로부터 비언어적 표현인 모션을 생성하는 연구를 소개한다. 유튜브 영상으로부터 데이터셋을 구축하고, Text to Motion의 기존 모델인 T2M-GPT와 이종 모달리티 데이터를 연계 학습한 VL-KE-T5의 언어 인코더를 활용하여 구현한 모델로 실험을 진행하였다. 실험 결과, 한국어 발화 텍스트에 대해 생성된 모션 표현은 FID 스코어 0.11의 성능으로 나타났으며, 한국어 발화 정보 기반 비언어 표현 정보 생성의 가능성을 보여주었다.
PDF

모멘트 및 free-form 변형기반 비선형 뇌영상 정합 (Non-liner brain image registration based on moment and free-form deformation)

김민정;최유주;김명희
- 한국멀티미디어학회:학술대회논문집
- /
- 한국멀티미디어학회 2004년도 춘계학술발표대회논문집
- /
- pp.271-274
- /
- 2004
영상정합을 통한 의료영상 분석방법들 중 동일환자에 대한 선형적 다중모달리티 정합이 널리 이용되고 있다. 그러나 실제적으로 여러 종류의 환자영상 취득이 어렵거나 해부학적 영상정보가 손실되는 경우가 적지 않다 본 논문에서는 표준 형상을 가지는 정상인 해부학적 뇌영상에 대한 환자 기능적 뇌영상의 정합방법을 제안한다. 먼저 두 영상간 모멘트 정보 매칭 및 초기선형 변환을 수행하고, 3차원 B zier 함수 기반 free-form 변형기법을 이용한 비선형 정합을 수행하여 정합 영상간 형상 차이를 최소화한다 제안방법은 환자 기능영상의 해부학적 분석 뿐 아니라 시술전-시술중 영상정합을 통한 영상유도시술에도 확장 적용될 수 있다.
PDF

가스 센서 데이터셋 시각화를 위한 데이터 전처리 기법 (Data Preprocessing Techniques for Visualizing Gas Sensor Datasets)

김준수;박경원;임태범;박구만
- 한국방송∙미디어공학회:학술대회논문집
- /
- 한국방송∙미디어공학회 2021년도 추계학술대회
- /
- pp.21-22
- /
- 2021
최근 AI(Artificial Intelligence)를 기반으로 정밀한 가스 성분 감지를 위한 후각지능(Olfactory intelligence) 기술에 연구가 활발히 진행 중이다. 후각지능 학습데이터는 다른 감지 방식의 가스 센서들이 동시에 적용되는 멀티모달리티의 특성을 지니며 또한, 공간상에 분포된 센서 배열을 통해 획득된 다차원의 시계열 특성을 지닌다. 따라서 대량의 다차원 데이터에 대한 정확한 이해와 분석을 위해서는 데이터를 전처리하고 시각화할 수 있는 기술이 필요하다. 본 논문에서는 후각지능 학습을 위한 다차원의 복잡한 가스 데이터의 시각화를 위해 잡음 등의 불필요한 값을 제거하고, 데이터가 일관성을 가지도록 하며, 데이터의 차원을 시각화 가능하도록 축소하기 위한 전처리 방법을 제시한다.
PDF

가상의 3D와 실제 로봇이 동기화하는 시스템 및 플랫폼 (Game Platform and System that Synchronize Actual Humanoid Robot with Virtual 3D Character Robot)

박창현;이창조
- 한국엔터테인먼트산업학회논문지
- /
- 제8권2호
- /
- pp.283-297
- /
- 2014
미래 인간의 삶은 사회, 경제, 정치와 개인 등 삶의 전 영역에 걸쳐 다학제적 기술의 파급효과 증대에 의해 혁신될 것이다. 특히 로봇 분야와 로봇을 이용한 차세대 게임 분야에서는 다학제적 기여와 상호작용에 의해 더욱 더 기술간 융합화가 가속화 될 것으로 전망된다. 본 연구는 지금까지의 "인간-로봇 인터페이스 기술"의 기술적인 한계 및 시공간적 제약을 뛰어넘는 새로운 인터페이스 모델로, 기존 인간-로봇 인터페이스 기술에서 가질 수 없는 다양한 모달리티(modality)들의 융합을 통해 보다 신뢰성 있으며 편하고 자유로운 "인간-로봇 인터페이스 기술"의 연구이다. 이족보행의 휴먼로봇과 모바일 기기 화면의 3D 콘텐츠(contents) 로봇(가상로봇)의 동작과 위치 값을 실시간적으로 연동하는 동기화(Synchronization) 엔진을 개발하고, 상호간의 정보를 주고받기 위한 무선 프로토콜(Protocol) 및 효율적인 티칭(Teaching)을 위한 학습에 의한, 다이렉트 티칭앤플레이(Direct Teaching & Play)의 티칭 프로그램 개발과, 이를 이용한 로봇 게임 시스템을 연구한다.

얼굴 영역 추출 시 여유값의 설정에 따른 개성 인식 모델 정확도 성능 분석 (Performance Analysis for Accuracy of Personality Recognition Models based on Setting of Margin Values at Face Region Extraction)

구욱;한규원;김봉재
- 한국인터넷방송통신학회논문지
- /
- 제24권1호
- /
- pp.141-147
- /
- 2024
최근 개인의 성향을 반영한 맞춤형 서비스가 각광 받고 있다. 이와 관련하여 개인의 개성을 인식하고 활용하고자 하는 연구가 지속적으로 이루어지고 있다. 각 개인의 개성을 인식하고 평가하는 방법은 다수가 있지만, OCEAN 모델이 대표적으로 사용된다. OCEAN 모델로 각 개인의 개성을 인식할 때 언어적, 준언어적, 비언어적 정보를 이용하는 멀티 모달리티 기반 인공지능 모델이 사용될 수 있다. 본 논문에서는 비언어적 정보인 사용자의 표정을 기반으로 OCEAN을 인식하는 인공지능 모델에서 영상 데이터에서 얼굴 영역을 추출할 때 지정하는 얼굴 영역 여유값(Margin)에 따른 개성 인식 모델 정확도 성능을 분석한다. 실험에서는 2D Patch Partition, R2plus1D, 3D Patch Partition, 그리고 Video Swin Transformer에 기반한 개성 인식 모델을 사용하였다. 얼굴 영역 추출 시 여유값을 60으로 사용했을 때 1-MAE 성능이 0.9118로 가장 우수하였다. 따라서 개성 인식 모델의 성능을 최적화하기 위해서는 적절한 여유값을 설정해야 함을 확인하였다.
https://doi.org/10.7236/JIIBC.2024.24.1.141 인용 PDF HTML

멀티 모달리티 데이터 활용을 통한 골다공증 단계 다중 분류 시스템 개발: 합성곱 신경망 기반의 딥러닝 적용 (Multi-classification of Osteoporosis Grading Stages Using Abdominal Computed Tomography with Clinical Variables : Application of Deep Learning with a Convolutional Neural Network)

하태준;김희상;강성욱;이두희;김우진;문기원;최현수;김정현;김윤;박소현;박상원
- 한국방사선학회논문지
- /
- 제18권3호
- /
- pp.187-201
- /
- 2024
골다공증은 전 세계적으로 주요한 건강 문제임에도 불구하고, 골절 발생 전까지 쉽게 발견되지 않는 단점을 가지고 있습니다. 본 연구에서는 골다공증 조기 발견 능력 향상을 위해, 복부 컴퓨터 단층 촬영(Computed Tomography, CT) 영상을 활용하여 정상-골감소증-골다공증으로 구분되는 골다공증 단계를 체계적으로 분류할 수 있는 딥러닝(Deep learning, DL) 시스템을 개발하였습니다. 총 3,012개의 조영제 향상 복부 CT 영상과 개별 환자의 이중 에너지 X선 흡수 계측법(Dual-Energy X-ray Absorptiometry, DXA)으로 얻은 T-점수를 활용하여 딥러닝 모델 개발을 수행하였습니다. 모든 딥러닝 모델은 비정형 이미지 데이터, 정형 인구 통계 정보 및 비정형 영상 데이터와 정형 데이터를 동시에 활용하는 다중 모달 방법에 각각 모델 구현을 실현하였으며, 모든 환자들은 T-점수를 통해 정상, 골감소증 및 골다공증 그룹으로 분류되었습니다. 가장 높은 정확도를 갖는 모델 우수성은 비정형-정형 결합 데이터 모델이 가장 우수하였으며, 수신자 조작 특성 곡선 아래 면적이 0.94와 정확도가 0.80를 제시하였습니다. 구현된 딥러닝 모델은 그라디언트 가중치 클래스 활성화 매핑(Gradient-weighted Class Activation Mapping, Grad-CAM)을 통해 해석되어 이미지 내에서 임상적으로 관련된 특징을 강조했고, 대퇴 경부가 골다공증을 통해 골절 발생이 높은 위험 부위임을 밝혔습니다. 이 연구는 DL이 임상 데이터에서 골다공증 단계를 정확하게 식별할 수 있음을 보여주며, 조기에 골다공증을 탐지하고 적절한 치료로 골절 위험을 줄일 수 있는 복부 컴퓨터 단층 촬영 영상의 잠재력을 제시할 수 있습니다.
https://doi.org/10.7742/jksr.2024.18.3.187 인용 PDF HTML

IoT 환경에서 인터유저빌리티(Interusability) 개선을 위한 사물성격(Personality of Things)중심의 UI 프로토타이핑에 대한 연구 (A Study on UI Prototyping Based on Personality of Things for Interusability in IoT Environment)

안미경;박남춘
- 한국HCI학회논문지
- /
- 제13권2호
- /
- pp.31-44
- /
- 2018
사물인터넷(Internet of Things)시대에는 다양한 사물이 연결되어 사물들 스스로가 데이터를 획득하여 이를 바탕으로 학습하고 동작한다. 이는 사물이 사람의 모습을 닮아가고 있다고 볼 수 있고 변화한 사물과 사람이 어떻게 소통하는가를 설계하는 것이 핵심 이슈로 떠오르고 있다. 이러한 IoT 환경이 도래함에 따라 UI 디자인 분야에서도 많은 연구가 진행되었다. 멀티모달리티(Multi-modality)와 인터유저빌리티(Interusability) 등의 키워드를 통해서 UI 분야에서도 복합적인 요소를 고려하려는 연구가 진행됐음을 알 수 있다. 하지만 기존의 UI 디자인 방법론으로는 IoT 환경에서 사용자 인터페이스(UI)를 설계할 때 사물, 사람, 데이터가 상호작용하는 방식에 대해서 구조화하고 테스트하는데 한계가 있다. 따라서 본 연구에서 새로운 UI 프로토타이핑 방법을 제안하였다. 본 논문의 주요 분석과 연구는 다음과 같다: (1) 먼저 사물의 행동 프로세스를 정의하였다. (2) 행동 프로세스를 토대로 기존의 IoT 제품을 분석하였다. (3) 사물성격(Personality of Things)유형을 구분 지을 수 있는 프레임워크를 제작하였다. (4) 프레임워크를 바탕으로 사물성격(Personality of Things) 유형을 도출하였다. (5) 3개의 대표 사물성격(Personality of Things)을 실제 스마트 홈 서비스에 적용하여 프로토타이핑 테스트를 해보았다. 본 연구는 새로운 UI 프로토타이핑 방법을 제안하여 더 총체적인 방식으로 IoT 서비스에 대한 사용자 경험(UX)을 확인할 수 있었다는 데 의의가 있다. 또한, 향후 본 연구를 발전시켜 인공지능(AI) 기술이 발전한 환경에서 지능화된 서비스의 정체성(Identity) 확립의 도구로 사물성격(Personality of Things) 개념을 활용할 수 있을 것이라 생각한다.
PDF

검색결과 30건 처리시간 0.031초

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

자세히 찾기

이미지 검색 (β)