Search | Korea Science

Effective Utilization of Domain Knowledge for Relational Reinforcement Learning (관계형 강화 학습을 위한 도메인 지식의 효과적인 활용)

Kang, MinKyo;Kim, InCheol
- KIPS Transactions on Software and Data Engineering
- /
- v.11 no.3
- /
- pp.141-148
- /
- 2022
Recently, reinforcement learning combined with deep neural network technology has achieved remarkable success in various fields such as board games such as Go and chess, computer games such as Atari and StartCraft, and robot object manipulation tasks. However, such deep reinforcement learning describes states, actions, and policies in vector representation. Therefore, the existing deep reinforcement learning has some limitations in generality and interpretability of the learned policy, and it is difficult to effectively incorporate domain knowledge into policy learning. On the other hand, dNL-RRL, a new relational reinforcement learning framework proposed to solve these problems, uses a kind of vector representation for sensor input data and lower-level motion control as in the existing deep reinforcement learning. However, for states, actions, and learned policies, It uses a relational representation with logic predicates and rules. In this paper, we present dNL-RRL-based policy learning for transportation mobile robots in a manufacturing environment. In particular, this study proposes a effective method to utilize the prior domain knowledge of human experts to improve the efficiency of relational reinforcement learning. Through various experiments, we demonstrate the performance improvement of the relational reinforcement learning by using domain knowledge as proposed in this paper.
https://doi.org/10.3745/KTSDE.2022.11.3.141 인용 PDF KSCI

하계 전기, 전자연합학술회의 및 산학협동 심포지엄 초록

대한전기학회
- 전기의세계
- /
- v.27 no.5
- /
- pp.33-54
- /
- 1978
(차례) 1.산학협동심포지업 (1)우리나라에서의 연구개발과 산학협동 (2)산학협동과 산업계의 역할 (3)산학협동의 현황과 진로 2.학술회의A (1)전력게통의 계층구조와 협조원리에 관한 연구 (2)2중층괴상회전자 유도전동기의 이론해석 (3)초고주파가열장치에 사용하는 철공진변압기의 해석적 설계 (4)한국전기기시험연구소 대전력단락 시험설비설계 (5)직류전동기제어를 위한 Thyristor Chopper정류회로에 관한 연구 (6)선로의 개폐정보를 포함하는 전력계통의 상태추정 (7)단일신경세포에 대한 ITEM 신호 특성 3.학술회의B (1)MMM-1 Computer System의 설계 및 제작 (2)Adaptive Delta Modulation System의 성능비교 연구 (3)6GHZ FMD마이크로파 무선전송장치의 개발 (4)적선도에 의한 회로망함수의 결정 (5)동맥혈압의 해석과 그의 전기적 유사모델 (6)피부감각의 정보전달 특성에 관하여 (7)선형직접회로의 공정설계 및 그 특성 조성 (8)DH L.D의 전기적포화현상에 관한 이론적 해석 (9)Potocoupler를 이용한 Isolator 4.학술회의C (1)Al-Al$_{2}$O$_{3}$ -Al박막구조의 전기적 특성 (2)이종금속에 샌드위치된 고분자물질의 단락전조 (3)유전체가 일부체워진 직 6면체의 캐비티의 다중모오드 해석 (4)반도체 가스 검지소자의 제조 및 그의 전기적 특성 (5)실리콘 산화공정에 대한 실험적 고찰 (6)진공증착법에 의한 InSb 박막제도에서 열처리효과 (7)(Ba$_{1}$-xBix) Tio$_{3}$ PTC thermistor의 첨가량의 최적건안 (8)금속박막증착시 두께조절 5.특별강연회 (1)일본에 있어서의 절력계통공학연구 (2)Linear Motor의 최근개발동향량도 높았다. valine과 leucine 및 aspartic acid, glycine과 glutamic acid, leucine과 aspartic acid 간에는 고도의 정상관, glycine과 serine, valine과 phenylalanine, threonine과 proline, phenylalanine과 arginine, methionine과 glutamic acid, histidine과 lysine 간에는 유의 정상관, 그리고 isoleucine과 lysine 간에는 유의한 부상관이 있었다. 4. lysine 함량은 단백질 함량과 정산곤, isoleucine 함량은 단빅질 함량과 부상관을 보였으며, alanine, valine, leucine 함량은 지방함량과 각각 유의한 정산관을 보였다. 5. 대두 단백질은 7.5% acrylamide gel 전기영동에 의해 품종에 따라 12～16개의 구성분으로 분리되었으며, 이들중 주구성분들은 상대이동도가 0.06(a), 0.14(b). 0.24(d) 이었고, 구성분 b의 함량이 품종간에 가장 변이가 컸으며, 구성분 b는 그밖의 주요 구성분들의 함량과 부의 상관이 있었고, 구성분 a는 단백질 함량과 정상관이 있었다. 6. 종실단백질 구성분들의 조합 특성 면에서 공시 86품종은 11개 유형군으로 분류되었으며, 우리나라와 일본품종은 미국품종에 비해 단백질구성분 조성이 훨씬 다양하였다. 7. 이동도가 매우 빠른 단백질 구성분 o(Rm 0.77) p(Rm 0.81)를 모두 갖고 있는 품종은 3품종, 모두 갖고 있지 않은 품종은 1품종이었고, 나머지 82품종은 o나 p중 한 구성분을 갖고 있었으며 그 분포율은 30 : 65 이었는데 미국계 품종은 우리나라 품종에 비해 구성분 o를 간고 있는 비율이 현저히 적었다. 8. 대두 종실은 개화후 22일까지 완만히, 그 이후 20～30일간 급속히
PDF

Analysis of the Impact of Reflected Waves on Deep Neural Network-Based Heartbeat Detection for Pulsatile Extracorporeal Membrane Oxygenator Control (반사파가 박동형 체외막산화기 제어에 사용되는 심층신경망의 심장 박동 감지에 미치는 영향 분석)

Seo Jun Yoon;Hyun Woo Jang;Seong Wook Choi
- Journal of Biomedical Engineering Research
- /
- v.45 no.3
- /
- pp.128-137
- /
- 2024
It is necessary to develop a pulsatile Extracorporeal Membrane Oxygenator (p-ECMO) with counter-pulsation control(CPC), which ejects blood during the diastolic phase of the heart rather than the systolic phase, due to the known issues with conventional ECMO causing fatal complications such as ventricular dilation and pulmonary edema. A promising method to simultaneously detect the pulsations of the heart and p-ECMO is to analyze blood pressure waveforms using deep neural network technology(DNN). However, the accurate detection of cardiac rhythms by DNNs is challenging due to various noises such as pulsations from p-ECMO, reflected waves in the vessels, and other dynamic noises. This study aims to evaluate the accuracy of DNNs developed for CPC in p-ECMO, using human-like blood pressure waveforms reproduced in an in-vitro experiment. Especially, an experimental setup that reproduces reflected waves commonly observed in actual patients was developed, and the impact of these waves on DNN judgments was assessed using a multiple DNN (m-DNN) that provides accurate determinations along with a separate index for heartbeat recognition ability. In the experimental setup inducing reflected waves, it was observed that the shape of the blood pressure waveform became increasingly complex, which coincided with an increase in harmonic components, as evident from the Fast Fourier Transform results of the blood pressure wave. It was observed that the recognition score (RS) of DNNs decreased in blood pressure waveforms with significant harmonic components, separate from the frequency components caused by the heart and p-ECMO. This study demonstrated that each DNN trained on blood pressure waveforms without reflected waves showed low RS when faced with waveforms containing reflected waves. However, the accuracy of the final results from the m-DNN remained high even in the presence of reflected waves.
https://doi.org/10.9718/JBER.2024.45.3.128 인용 PDF

On-Line Determination Steady State in Simulation Output (시뮬레이션 출력의 안정상태 온라인 결정에 관한 연구)

이영해;정창식;경규형
- Proceedings of the Korea Society for Simulation Conference
- /
- 1996.05a
- /
- pp.1-3
- /
- 1996
시뮬레이션 기법을 이용한 시스템의 분석에 있어서 실험의 자동화는 현재 많은 연구와 개발이 진행 중인 분야이다. 컴퓨터와 정보통신 시스템에 대한 시뮬레이션의 예를 들어 보면, 수많은 모델을 대한 시뮬레이션을 수행할 경우 자동화된 실험의 제어가 요구되고 있다. 시뮬레이션 수행회수, 수행길이, 데이터 수집방법 등과 관련하여 시뮬레이션 실험방법이 자동화가 되지 않으면, 시뮬레이션 실험에 필요한 시간과 인적 자원이 상당히 커지게 되며 출력데이터에 대한 분석에 있어서도 어려움이 따르게 된다. 시뮬레이션 실험방법을 자동화하면서 효율적인 시뮬레이션 출력분석을 위해서는 시뮬레이션을 수행하는 경우에 항상 발생하는 초기편의 (initial bias)를 제거하는 문제가 선결되어야 한다. 시뮬레이션 출력분석에 사용되는 데이터들이 초기편의를 반영하지 않는 안정상태에서 수집된 것이어야만 실제 시스템에 대한 올바른 해석이 가능하다. 실제로 시뮬레이션 출력분석과 관련하여 가장 중요하면서도 어려운 문제는 시뮬레이션의 출력데이터가 이루는 추계적 과정 (stochastic process)의 안정상태 평균과 이 평균에 대한 신뢰구간(confidence interval: c. i.)을 구하는 것이다. 한 신뢰구간에 포함되어 있는 정보는 의사결정자에게 얼마나 정확하게 평균을 추정할 구 있는지 알려 준다. 그러나, 신뢰구간을 구성하는 일은 하나의 시뮬레이션으로부터 얻어진 출력데이터가 일반적으로 비정체상태(nonstationary)이고 자동상관(autocorrelated)되어 있기 때문에, 전통적인 통계적인 기법을 직접적으로 이용할 수 없다. 이러한 문제를 해결하기 위해 시뮬레이션 출력데이터 분석기법이 사용된다.본 논문에서는 초기편의를 제거하기 위해서 필요한 출력데이터의 제거시점을 찾는 새로운 기법으로, 유클리드 거리(Euclidean distance: ED)를 이용한 방법과 현재 패턴 분류(pattern classification) 문제에 널리 사용 중인 역전파 신경망(backpropagation neural networks: BNN) 알고리듬을 이용하는 방법을 제시한다. 이 기법들은 대다수의 기존의 기법과는 달리 시험수행(pilot run)이 필요 없으며, 시뮬레이션의 단일수행(single run) 중에 제거시점을 결정할 수 있다. 제거시점과 관련된 기존 연구는 다음과 같다. 콘웨이방법은 현재의 데이터가 이후 데이터의 최대값이나 최소값이 아니면 이 데이터를 제거시점으로 결정하는데, 알고기듬 구조상 온라인으로 제거시점 결정이 불가능하다. 콘웨이방법이 알고리듬의 성격상 온라인이 불가능한 반면, 수정콘웨이방법 (Modified Conway Rule: MCR)은 현재의 데이터가 이전 데이터와 비교했을 때 최대값이나 최소값이 아닌 경우 현재의 데이터를 제거시점으로 결정하기 때문에 온라인이 가능하다. 평균교차방법(Crossings-of-the-Mean Rule: CMR)은 누적평균을 이용하면서 이 평균을 중심으로 관측치가 위에서 아래로, 또는 아래서 위로 교차하는 회수로 결정한다. 이 기법을 사용하려면 교차회수를 결정해야 하는데, 일반적으로 결정된 교차회수가 시스템에 상관없이 일반적으로 적용가능하지 않다는 문제점이 있다. 누적평균방법(Cumulative-Mean Rule: CMR2)은 여러 번의 시험수행을 통해서 얻어진 출력데이터에 대한 총누적평균(grand cumulative mean)을 그래프로 그린 다음, 안정상태인 점을 육안으로 결정한다. 이 방법은 여러 번의 시뮬레이션을 수행에서 얻어진 데이터들의 평균들에 대한 누적평균을 사용하기 매문에 온라인 제거시점 결정이 불가능하며, 작업자가 그래프를 보고 임의로 결정해야 하는 단점이 있다. Welch방법(Welch's Method: WM)은 브라운 브리지(Brownian bridge) 통계량()을 사용하는데, n이 무한에 가까워질 때, 이 브라운 브리지 분포(Brownian bridge distribution)에 수렴하는 성질을 이용한다. 시뮬레이션 출력데이터를 가지고 배치를 구성한 후 하나의 배치를 표본으로 사용한다. 이 기법은 알고리듬이 복잡하고, 값을 추정해야 하는 단점이 있다. Law-Kelton방법(Law-Kelton's Method: LKM)은 회귀 (regression)이론에 기초하는데, 시뮬레이션이 종료된 후 누적평균데이터에 대해서 회귀직선을 적합(fitting)시킨다. 회귀직선의 기울기가 0이라는 귀무가설이 채택되면 그 시점을 제거시점으로 결정한다. 일단 시뮬레이션이 종료된 다음, 데이터가 모아진 순서의 반대 순서로 데이터를 이용하기 때문에 온라인이 불가능하다. Welch절차(Welch's Procedure: WP)는 5회이상의 시뮬레이션수행을 통해 수집한 데이터의 이동평균을 이용해서 시각적으로 제거시점을 결정해야 하며, 반복제거방법을 사용해야 하기 때문에 온라인 제거시점의 결정이 불가능하다. 또한, 한번에 이동할 데이터의 크기(window size)를 결정해야 한다. 지금까지 알아 본 것처럼, 기존의 방법들은 시뮬레이션의 단일 수행 중의 온라인 제거시점 결정의 관점에서는 미약한 면이 있다. 또한, 현재의 시뮬레이션 상용소프트웨어는 작업자로 하여금 제거시점을 임의로 결정하도록 하기 때문에, 실험중인 시스템에 대해서 정확하고도 정량적으로 제거시점을 결정할 수 없게 되어 있다. 사용자가 임의로 제거시점을 결정하게 되면, 초기편의 문제를 효과적으로 해결하기 어려울 뿐만 아니라, 필요 이상으로 너무 많은 양을 제거하거나 초기편의를 해결하지 못할 만큼 너무 적은 양을 제거할 가능성이 커지게 된다. 또한, 기존의 방법들의 대부분은 제거시점을 찾기 위해서 시험수행이 필요하다. 즉, 안정상태 시점만을 찾기 위한 시뮬레이션 수행이 필요하며, 이렇게 사용된 시뮬레이션은 출력분석에 사용되지 않기 때문에 시간적인 손실이 크게 된다.
PDF

Search Result 874, Processing Time 0.025 seconds

Effective Utilization of Domain Knowledge for Relational Reinforcement Learning (관계형 강화 학습을 위한 도메인 지식의 효과적인 활용)

하계 전기, 전자연합학술회의 및 산학협동 심포지엄 초록

Analysis of the Impact of Reflected Waves on Deep Neural Network-Based Heartbeat Detection for Pulsatile Extracorporeal Membrane Oxygenator Control (반사파가 박동형 체외막산화기 제어에 사용되는 심층신경망의 심장 박동 감지에 미치는 영향 분석)

On-Line Determination Steady State in Simulation Output (시뮬레이션 출력의 안정상태 온라인 결정에 관한 연구)

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)