• 제목/요약/키워드: AI speaker

검색결과 73건 처리시간 0.028초

AI-based language tutoring systems with end-to-end automatic speech recognition and proficiency evaluation

  • Byung Ok Kang;Hyung-Bae Jeon;Yun Kyung Lee
    • ETRI Journal
    • /
    • 제46권1호
    • /
    • pp.48-58
    • /
    • 2024
  • This paper presents the development of language tutoring systems for nonnative speakers by leveraging advanced end-to-end automatic speech recognition (ASR) and proficiency evaluation. Given the frequent errors in non-native speech, high-performance spontaneous speech recognition must be applied. Our systems accurately evaluate pronunciation and speaking fluency and provide feedback on errors by relying on precise transcriptions. End-to-end ASR is implemented and enhanced by using diverse non-native speaker speech data for model training. For performance enhancement, we combine semisupervised and transfer learning techniques using labeled and unlabeled speech data. Automatic proficiency evaluation is performed by a model trained to maximize the statistical correlation between the fluency score manually determined by a human expert and a calculated fluency score. We developed an English tutoring system for Korean elementary students called EBS AI Peng-Talk and a Korean tutoring system for foreigners called KSI Korean AI Tutor. Both systems were deployed by South Korean government agencies.

텍스트 마이닝 기반 사용자 경험 분석 및 관리: 스마트 스피커 사례 (User Experience Analysis and Management Based on Text Mining: A Smart Speaker Case)

  • 연다인;박가연;김희웅
    • 경영정보학연구
    • /
    • 제22권2호
    • /
    • pp.77-99
    • /
    • 2020
  • 스마트 스피커는 인공지능을 활용하여 음악, 일정, 날씨, 상품 등 다양한 정보와 콘텐츠들을 검색, 이용할 수 있는 대화형 음성 기반 서비스를 제공하는 기기이다. 인공지능 기술은 데이터가 축적될수록 이를 활용하여 더욱 정교하고 최적화된 서비스를 이용자에게 제공한다. 따라서 스마트 스피커 제조사들은 초기에 공격적인 마케팅을 통해 플랫폼 구축에 힘썼다. 하지만 스마트 스피커의 사용빈도는 월 1회 미만이 전체의 3분의 1 이상을 차지하고, 사용자 만족도도 49%에 그치는 것으로 나타났다. 이에 지속적인 이용활성화와 만족도 증진을 위해 스마트 스피커의 사용자 경험을 강화할 필요성이 대두되었다. 이에 본 연구에서는 스마트 스피커의 사용자 경험을 분석하고, 이를 바탕으로 스마트 스피커의 사용자 경험 강화 방안을 제시하고자 한다. 본 연구는 사용자가 직접 작성한 실제 리뷰 데이터를 수집하여 스마트 스피커 사용자 경험 차원을 기반으로 분석 결과를 해석했다는 점에서 의의가 있다. 또한 스마트 스피커 사용자 경험 차원을 개발하여 텍스트 마이닝 결과를 해석한 것에서 학술적 의의가 있다. 본 연구 결과를 통해 스마트 스피커 제조사에게 실무적으로 사용자 경험 강화를 위한 전략을 제안할 수 있다.

언론은 인공지능(AI)을 어떻게 다루는가?: 뉴스 빅데이터를 통한 한국과 미국의 보도 경향 분석 (How Does the Media Deal with Artificial Intelligence?: Analyzing Articles in Korea and the US through Big Data Analysis)

  • 박종화;김민성;김정환
    • 한국정보시스템학회지:정보시스템연구
    • /
    • 제31권1호
    • /
    • pp.175-195
    • /
    • 2022
  • Purpose The purpose of this study is to examine news articles and analyze trends and key agendas related to artificial intelligence(AI). In particular, this study tried to compare the reporting behaviors of Korea and the United States, which is considered to be a leader in the field of AI. Design/methodology/approach This study analyzed news articles using a big data method. Specifically, main agendas of the two countries were derived and compared through the keyword frequency analysis, topic modeling, and language network analysis. Findings As a result of the keyword analysis, the introduction of AI and related services were reported importantly in Korea. In the US, the war of hegemony led by giant IT companies were widely covered in the media. The main topics in Korean media were 'Strategy in the 4th Industrial Revolution Era', 'Building a Digital Platform', 'Cultivating Future human resources', 'Building AI applications', 'Introduction of Chatbot Services', 'Launching AI Speaker', and 'Alphago Match'. The main topics of US media coverage were 'The Bright and Dark Sides of Future Technology', 'The War of Technology Hegemony', 'The Future of Mobility', 'AI and Daily Life', 'Social Media and Fake News', and 'The Emergence of Robots and the Future of Jobs'. The keywords with high centrality in Korea were 'release', 'service', 'base', 'robot', 'era', and 'Baduk or Go'. In the US, they were 'Google', 'Amazon', 'Facebook', 'China', 'Car', and 'Robot'.

인공지능 서비스의 사용자 수용 의도에 관한 연구 : 대화형 AI서비스 필요성에 대한 인식에 영향을 주는 요인을 중심으로 (A Study on the Users Intention to Adopt an Intelligent Service: Focusing on the Factors Affecting the Perceived Necessity of Conversational A.I. Service)

  • 전소원;이지희;이종태
    • 기술혁신학회지
    • /
    • 제22권2호
    • /
    • pp.242-264
    • /
    • 2019
  • 본 연구는 빠르게 확산되고 있는 인공지능 기반 서비스에 대한 사용자들의 수용 의도에 영향을 주는 요인을 분석하는 연구이다. 구체적으로는, 본 연구는 인공지능 기반 서비스의 사용자들의 수용 의도에 영향을 주는 요인 중, TAM, UTAUT 기반 연구와 같은 기존의 선행 연구들이 제시한 바 있는 쾌락적 동기, 실용적 동기와 함께, 인공지능 기반 서비스의 사용 안전성에 대한 사용자 인식, 이들 서비스의 필요성을 강조하는 시대적 압박, 서비스의 혁신성과 서비스의 체험 경험 등의 요인들이 주는 직 간접적인 영향을 집중적으로 분석한다. 분석 결과, 제시된 요인들은 A.I. 스피커에 대한 소비자의 사용 의도에 유의미한 영향을 미치는 것으로 나타났다. 보다 구체적으로는, 기존에 다양한 연구에서 제시되어 온 TAM, UTAUT모형에서 제시되어온 편의성과 쾌락적/실용적 동기가 A.I. 스피커로 대표되는 지능형 서비스의 사용자 수용 의도에도 유의미한 요인임을 증명하였다. 이와 함께, 기존에는 소수의 연구에서만 고려되었던 시대적 압박이라는 비자발적 영향 요인이 지능형 서비스를 포함한 IT융합형 서비스의 수용 의도에 유의미한 영향력을 나타내었으며, 이러한 서비스에 대한 사용자의 보안성 인지와 지능형 서비스(A.I. 스피커)의 실제 경험 여부 또한 중요한 영향요인으로 제시되었다.

이커머스 환경에서 구매와 공유 행동을 이용한 기기 중심 개인화 상품 정보 추천 기법 (Device-Centered Personalized Product Recommendation Method using Purchase and Share Behavior in E-Commerce Environment)

  • 권준희
    • 디지털산업정보학회논문지
    • /
    • 제18권4호
    • /
    • pp.85-96
    • /
    • 2022
  • Personalized recommendation technology is one of the most important technologies in electronic commerce environment. It helps users overcome information overload by suggesting information that match user's interests. In e-commerce environment, both mobile device users and smart device users have risen dramatically. It creates new challenges. Our method suggests product information that match user's device interests beyond only user's interests. We propose a device-centered personalized recommendation method. Our method uses both purchase and share behavior for user's devices interests. Moreover, it considers data type preference for each device. This paper presents a new recommendation method and algorithm. Then, an e-commerce scenario with a computer, a smartphone and an AI-speaker are described. The scenario shows our work is better than previous researches.

AWS와 라즈베리 파이를 활용한 AI 스케줄러에 대한 연구 (AI Scheduler using AWS and Raspberry Pi)

  • 전지원;임채연;정병호;이성진;문상호
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2021년도 추계학술대회
    • /
    • pp.370-372
    • /
    • 2021
  • 보건복지부 노인성 치매 임상 연구센터에 따르면 2020년 65세 이상의 한국 노인 중 치매환자 수는 84만 명으로 치매 유병률은 10.39%에 달한다. 노인 10명 중 1명이 걸릴 정도의 유병률이지만 가족이 하루 종일 돌보기에는 어려움이 있다. 일정 관리가 저장된 AI 스피커 시스템을 활용하면 독거 노인의 상태 및 일정을 관리할 수 있다고 판단된다. 본 논문은 치매환자의 AI 스케쥴러를 위한 모듈을 구현하였다. 라즈베리 파이의 내부에 원격 IoT인 AWS를 연동하고, 구글 API의 캘린더를 활용하여 일정을 스피커로 출력하도록 구성되었다. 본 연구를 통해, 일정관리의 용이함으로 치매 환자 관리 및 일정 조정에 도움 될 것으로 판단된다.

  • PDF

다음색 감정 음성합성 응용을 위한 감정 SSML 처리기 (An emotional speech synthesis markup language processor for multi-speaker and emotional text-to-speech applications)

  • 유세희;조희;이주현;홍기형
    • 한국음향학회지
    • /
    • 제40권5호
    • /
    • pp.523-529
    • /
    • 2021
  • 본 논문에서는 감정 마크업을 포함하는 Speech Synthesis Markup Language(SSML) 처리기를 설계하고 개발하였다. 다양한 음색과 감정 표현이 가능한 음성합성 기술이 개발되고 있으며 다양한 음색 및 감정 음성합성의 응용 확대를 위하여 표준화된 음성 인터페이스 마크업 언어인 SSML을 감정 표현이 가능하도록 확장한 감정 SSML(Emotional SSML)을 설계하였다. 감정 SSML 처리기는 그래픽 사용자 인터페이스로 손쉽게 음색 및 감정을 원하는 텍스트 부분에 표시할 수 있는 다음색 감정 텍스트 편집기, 편집 결과를 감정 SSML 문서로 생성하는 감정 SSML 문서 생성기, 생성된 감정 SSML 문서를 파싱하는 감정 SSML 파서, 감정 SSML 파서의 결과인 다음색 감정 합성 시퀀스를 기반으로 합성기와 연동하여 음성 스트림의 합성 을 제어하는 시퀀서로 구성된다. 본 논문에서 개발한 다음색 감정합성을 위한 감정 SSML 처리기는 프로그래밍 언어 및 플랫폼 독립적인 개방형 표준인 SSML을 기반으로 하여 다양한 음성합성 엔진에 쉽게 연동할 수 있는 구조를 가지며 다양한 음색과 감정 음성합성이 필요한 다양한 응용 개발에 활용될 것으로 기대한다.

인공지능 스피커를 활용한 주문결제 시스템의 설계 및 구현 (Design and Implementation of Order Settlement System Using Artificial Intelligence Speaker)

  • 김동현;최병현;반재훈
    • 한국전자통신학회논문지
    • /
    • 제14권6호
    • /
    • pp.1181-1186
    • /
    • 2019
  • 최근에 패스트푸드점, 개인이 운영하는 소규모 식당이나 카페 등에서도 키오스크를 이용하여 주문하고 결제하는 모습들을 흔하게 볼 수 있다. 팔을 사용하는데 불편한 장애인과 휠체어에 앉아 있는 장애인들은 그래픽 버튼을 눌러 사용하기가 어렵고, 노인들은 나이가 많아질수록 새로운 정보를 받아들이는 인지능력이 떨어져 사용하기에 불편함을 느낀다. 본 논문에서는 이러한 문제점을 보완하기 위해 사용자가 키오스크와 상호작용을 할 때 기본적으로 제공되는 시각적인 명령요소에 인공지능 스피커의 음성적 명령요소를 추가하여 키오스크에서 음성으로 명령을 수행할 수 있는 주문결제 시스템을 설계하고 구현한다.

RawNet3 화자 표현을 활용한 임의의 화자 간 음성 변환을 위한 StarGAN의 확장 (Extending StarGAN-VC to Unseen Speakers Using RawNet3 Speaker Representation)

  • 박보경;박소민;홍현기
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제12권7호
    • /
    • pp.303-314
    • /
    • 2023
  • 음성 변환(Voice Conversion)은 개인의 음성 데이터를 다른 사람의 음향적 특성(음조, 리듬, 성별 등)으로 재생성할 수 있는 기술로, 교육, 의사소통, 엔터테인먼트 등 다양한 분야에서 활용되고 있다. 본 논문은 StarGAN-VC 모델을 기반으로 한 접근 방식을 제안하여, 병렬 발화(Utterance) 없이도 현실적인 음성을 생성할 수 있다. 고정된 원본(source) 및 목표(target)화자 정보의 원핫 벡터(One-hot vector)를 이용하는 기존 StarGAN-VC 모델의 제약을 극복하기 위해, 본 논문에서는 사전 훈련된 Rawnet3를 사용하여 목표화자의 특징 벡터를 추출한다. 이를 통해 음성 변환은 직접적인 화자 간 매핑 없이 잠재 공간(latent space)에서 이루어져 many-to-many를 넘어서 any-to-any 구조가 가능하다. 기존 StarGAN-VC 모델에서 사용된 손실함수 외에도, Wasserstein-1 거리를 사용하여 생성된 음성 세그먼트가 목표 음성의 음향적 특성과 일치하도록 보장했다. 또한, 안정적인 훈련을 위해 Two Time-Scale Update Rule (TTUR)을 사용한다. 본 논문에서 제시한 평가 지표들을 적용한 실험 결과에 따르면, 제한된 목소리 변환만이 가능한 기존 StarGAN-VC 기법 대비, 본 논문의 제안 방법을 통해 다양한 발화자에 대한 성능이 개선된 음성 변환을 제공할 수 있음을 정량적으로 확인하였다.

시각장애인의 라이프 사이클을 지원하는 인공지능 웨어러블 플랫폼 (Artificial intelligence wearable platform that supports the life cycle of the visually impaired)

  • 박시웅;김정은;강현서;박형준
    • Journal of Platform Technology
    • /
    • 제8권4호
    • /
    • pp.20-28
    • /
    • 2020
  • 본 논문에서는 시각장애인의 라이프 사이클을 사전에 학습하여 시각장애인의 자립생활을 돕는 적정기술로 음성인식 기반 스마트 웨어러블 디바이스, 스마트 기기 및 웹 AI서버를 포함하는 음성, 사물 및 문자 인식 플랫폼을 제안하였다. 시각장애인용 웨어러블 기기는 착용편의성과 사물인식기능 효율을 높이기 위해 리버스 넥밴드 구조로 설계하여 제작하였으며, 웨어러블 기기에 부착된 고감도 소형 마이크와 스피커는 웨어러블 기기와 연동된 스마트기기의 앱으로 구성된 음성인식 인터페이스 기능을 지원하도록 구성하였다. 음성, 사물 및 광학문자 인식 서비스는 웹 AI 서버에서 오픈소스 및 구글 API를 활용하였고, 서비스 플랫폼의 음성, 사물 및 광학문자 인식 정밀도는 실험을 통하여 평균 90%이상 달성하였음을 확인하였다.

  • PDF