Cancers of the lung and liver are the top 10 leading causes of cancer death worldwide. Thus, it is essential to identify the genes specifically expressed in these two cancer types to develop new therapeutics. Although many messenger RNA (mRNA) sequencing data related to these cancer cells are available due to the advancement of next-generation sequencing (NGS) technologies, optimized data processing methods need to be developed to identify the novel cancer-specific genes. Here, we conducted an analytical comparison between Bowtie2, a Burrows-Wheeler transform-based alignment tool, and Kallisto, which adopts pseudo alignment based on a transcriptome de Bruijn graph using mRNA sequencing data on normal cells and lung/liver cancer tissues. Before using cancer data, simulated mRNA sequencing reads were generated, and the high Transcripts Per Million (TPM) values were compared. mRNA sequencing reads data on lung/liver cancer cells were also extracted and quantified. While Kallisto could directly give the output in TPM values, Bowtie2 provided the counts. Thus, TPM values were calculated by processing the Sequence Alignment Map (SAM) file in R using package Rsubread and subsequently in python. The analysis of the simulated sequencing data revealed that Kallisto could detect more transcripts and had a higher overlap over Bowtie2. The evaluation of these two data processing methods using the known lung cancer biomarkers concludes that in standard settings without any dedicated quality control, Kallisto is more effective at producing faster and more accurate results than Bowtie2. Such conclusions were also drawn and confirmed with the known biomarkers specific to liver cancer.
Abdulmonem Ahmed;Aybaba Hancrliogullari;Ali Riza Tosun
International Journal of Computer Science & Network Security
/
v.23
no.4
/
pp.1-6
/
2023
Morphological analysis is a branch of natural language processing, is now a rapidly growing field. The fundamental tenet of morphological analysis is that it can establish the roots or stems of words and enable comparison to the original term. Arabic is a highly inflected and derivational language and it has a strong structure. Each root or stem can have a large number of affixes attached to it due to the non-concatenative nature of Arabic morphology, increasing the number of possible inflected words that can be created. Accurate verb recognition and extraction are necessary nearly all issues in well-known study topics include Web Search, Information Retrieval, Machine Translation, Question Answering and so forth. in this work we have designed and implemented an algorithm to detect and recognize Arbic Verbs from Arabic text.The suggested technique was created with "Python" and the "pyqt5" visual package, allowing for quick modification and easy addition of new patterns. We employed 17 alternative patterns to represent all verbs in terms of singular, plural, masculine, and feminine pronouns as well as past, present, and imperative verb tenses. All of the verbs that matched these patterns were used when a verb has a root, and the outcomes were reliable. The approach is able to recognize all verbs with the same structure without requiring any alterations to the code or design. The verbs that are not recognized by our method have no antecedents in the Arabic roots. According to our work, the strategy can rapidly and precisely identify verbs with roots, but it cannot be used to identify verbs that are not in the Arabic language. We advise employing a hybrid approach that combines many principles as a result.
BITSE is a project of balloon-borne experiments for a next-generation solar coronagraph developed by a collaboration with KASI and NASA. The coronagraph is built to observe the linearly polarized brightness of solar corona with a polarization camera, a filter wheel, and an aperture door. For the observation, the coronagraph is supported by the power distribution unit (PDU), a pointing system WASP (Wallops Arc-Second Pointer), telemetry & telecommand system SIP (Support Instrument Package) which are developed at NASA's Goddard Space Flight Center, Wallops Flight Facility, and Columbia Scientific Balloon Facility. The BITSE Command and Data Handling (C&DH) system used a cost-off-the-shelf electronics to process all data sent and received by the coronagraph, including the support system operation by RS232/422, USB3, Ethernet, and digital and analog signals. The flight software is developed using the core Flight System (cFS) which is a reusable software framework and set of reusable software applications which take advantage of a rich heritage of successful space mission of NASA. The flight software can process encoding and decoding data, control the subsystems, and provide observation autonomy. We developed a python-based testing framework to improve software reliability. The flight software development is one of the crucial contributions of KASI and an important milestone for the next project which is developing a solar coronagraph to be installed at International Space Station.
Proceedings of the Korea Water Resources Association Conference
/
2021.06a
/
pp.478-478
/
2021
전 세계적으로 많은 나라들이 기후변화에 적응하기 위해 수자원 관리 전략을 마련하고 있으며, 수자원의 근간이 되는 빗물의 효율적 사용을 위해 우리나라에서도 빗물이용시설이 많이 도입되고 있다. 본 연구에서는 사용자 편의 환경(graphical user interface; GUI)을 갖춘 빗물이용시설의 용량 결정 프로그램(capacity design aid for rainwater harvesting; CARAH)을 개발하여 관련 연구와 업무에 활용성을 높이고자 하였다. CARAH는 저수지 질량 보존식과 python의 pyswarm package에 탑재된 메타 휴리스틱 방법 중 하나인 입자 군집 최적화(particle swarm optimization; PSO) 기법을 연계하여 빗물이용시설의 최적 용량을 짧은 시간에 결정될 수 있도록 개발되었다. 그리고, C#의 Windows Forms Application을 이용하여 사용자 편의 환경을 구현하였다. CARAH의 입력 자료는 모의 기간, 유입량, 목표공급량, 공급보장률이고, 출력 자료는 공급보장률-저류조용량, 목표공급량-실공급량-미달성량, 저류용량-유입량-실공급량이다. 빗물이용시설 계획에 필요한 여러 입력 자료를 쉽게 입력할 수 있도록 구현하였고, 그래프와 표의 형태로 계산된 결과를 화면에 직접 표출함으로써 사용자가 직관적으로 확인할 수 있도록 하였다. 한편, 입·출력 자료를 포함한 분석 결과는 파일로 관리할 수 있도록 기능을 갖추어 수정 및 보완 등의 반복적 활용이 가능하도록 하였다. 개발된 프로그램의 활용성을 검토하기 위해 실제 저류지가 설계된 인천의 청라지구 1공구를 대상으로 적용하였고, 분석 결과의 적절성을 확인하였다. 본 연구에서 개발된 CARAH는 빗물이용시설의 용량 결정에 관한 효율을 높일 수 있는 프로그램이고, 누구나 쉽고 간편하게 사용할 수 있는 프로그램으로서 향후 활용성이 높을 것으로 판단된다.
Objectives : This study aimed to analyze the trends in research and development projects related to herbal medicine and natural products in the field of traditional Korean medicine (TKM) over the past 20 years. Methods : Research projects were identified using "Korean medicine" as the subject heading in the National Science and Technology Information Service. The included projects investigated Korean medicine, natural products, or were related to the TKM industry. Data pre-processing and network analysis were performed using Python and Networkx package, and the network was visualized using the ForceAtlas2 visualization algorithm. Results : 1. Over the study period, 4,020 projects were conducted with a research budget of KRW 835.2 billion. Seven institutions performed over 100 projects each, accounting for 2.4% of all participating institutions, and the top 10 institutions accounted for 58.9% of total projects. 2. Obesity was the most frequently mentioned disease-related keyword. Chronic or age-related diseases such as diabetes, osteoporosis, dementia, parkinson's disease, cancer, inflammation, and asthma were also frequent research topics. Clinical research, safety, and standardization were also frequently mentioned. 3. Centrality analysis found that obesity was the only disease-related keyword identified, alongside TKM-related keywords. Standardization, safety, and clinical trials were identified as central keywords. Conclusions : The study found that research projects in TKM have focused on standardizing and ensuring the safety of herbal medicine, as well as on chronic and age-related diseases. Clinical studies aimed at verifying the effectiveness of herbal medicine were also frequent. These findings can guide future research and development in herbal medicine.
Journal of Wellbeing Management and Applied Psychology
/
v.7
no.3
/
pp.67-72
/
2024
This study developed a dry composite module-type deodorization facility with Twisting airflow changes and two forms (catalyst, adsorbent) within one module. Experiments were conducted to evaluate the reduction efficiency of odor substances C8H7N and C9H9N. The device combines UV oxidation using TiO2, catalytic oxidation using MnO2, and adsorption using A/C in five different methods. Data analysis of experimental results utilized the statistical package program Python 3.12. The program applied frequency analysis of odor removal efficiency, one-way ANOVA, and post-hoc tests, with statistical significance determined by p-value to ensure reliability and validity of the measurements. Results indicated that the highest removal efficiency of C8H7N and C9H9N was achieved by the UV+A/C method, suggesting the superior effectiveness and efficiency of the developed device. Combining multiple processes and technologies within one module enhanced odor treatment efficiency compared to using a single method. The device's modularity allows for flexibility in adapting to various sewage treatment scenarios, offering easy maintenance and cost-effective deodorization. This composite reaction module device can apply multiple technologies, such as biofilters, plasma, activated carbon filters, UV-photocatalysis, and electromagnetic-chemical systems. However, this study focused on UV-photocatalysis, catalysts, and activated carbon filters. Ultimately, the research demonstrates the practical applicability of this innovative device in real sewage treatment operations, showing excellent reduction efficiency and effectiveness by integrating UV oxidation, TiO2 photocatalysis, MnO2 catalytic oxidation, and A/C adsorption within a modular system.
Objectives The aim of this study is to analyze the patients who have low back pain through registry. Methods We registered patients with low back pain who visited department of korean rehabilitation medicine in university hospitals on study. We collected data from 116 subjects consisted of 51 inpatients and 65 outpatients and ruled out 8 who didn't have pattern identification data at the point of inpatient or outpatient visit so we analyzed 108 in total. We used Pearson's product moment correlation to find correlationship among variables, and analyzed statistical data using Phyton scipy library stats package. Results We set general features, region of the pain, physical examination, ROM, questionnaire results, pattern identification as variables and draw a conclusion by analyzing these variables. Conclusions Registry aimed at low back pain patients was established in department of korean rehabilitation medicine of university hospitals and exploratory analysis based on data were made. Through the registry, we expect that more advanced studies will be performed; for example, executing research which verifies effectiveness and stability of korean medical treatment or developing tools to fill the gap between pattern identification and disease identification.
Objectives: We analyzed Sasang constitution case reports using text mining to derive network analysis results and designed a classification algorithm using machine learning to select a model suitable for classifying Sasang constitution based on text data. Methods: Case reports on Sasang constitution published from January 1, 2000, to December 31, 2022, were searched. As a result, 343 papers were selected, yielding 454 cases. Extracted texts were pretreated and tokenized with the Python-based KoNLPy package. Each morpheme was vectorized using TF-IDF values. Word cloud visualization and centrality analysis identified keywords mainly used for classifying Sasang constitution in clinical practice. To select the most suitable classification model for diagnosing Sasang constitution, the performance of five models-XGBoost, LightGBM, SVC, Logistic Regression, and Random Forest Classifier-was evaluated using accuracy and F1-Score. Results: Through word cloud visualization and centrality analysis, specific keywords for each constitution were identified. Logistic regression showed the highest accuracy (0.839416), while random forest classifier showed the lowest (0.773723). Based on F1-Score, XGBoost scored the highest (0.739811), and random forest classifier scored the lowest (0.643421). Conclusions: This is the first study to analyze constitution classification by applying text mining and machine learning to case reports, providing a concrete research model for follow-up research. The keywords selected through text mining were confirmed to effectively reflect the characteristics of each Sasang constitution type. Based on text data from case reports, the most suitable machine learning models for diagnosing Sasang constitution are logistic regression and XGBoost.
Choi, Hyunseung;Kim, Mintae;Kim, Wooju;Shin, Dongwook;Lee, Yong Hun
Journal of Intelligence and Information Systems
/
v.24
no.4
/
pp.111-136
/
2018
In this paper, we propose a methodology to extract answer information about queries from various types of unstructured documents collected from multi-sources existing on web in order to expand knowledge base. The proposed methodology is divided into the following steps. 1) Collect relevant documents from Wikipedia, Naver encyclopedia, and Naver news sources for "subject-predicate" separated queries and classify the proper documents. 2) Determine whether the sentence is suitable for extracting information and derive the confidence. 3) Based on the predicate feature, extract the information in the proper sentence and derive the overall confidence of the information extraction result. In order to evaluate the performance of the information extraction system, we selected 400 queries from the artificial intelligence speaker of SK-Telecom. Compared with the baseline model, it is confirmed that it shows higher performance index than the existing model. The contribution of this study is that we develop a sequence tagging model based on bi-directional LSTM-CRF using the predicate feature of the query, with this we developed a robust model that can maintain high recall performance even in various types of unstructured documents collected from multiple sources. The problem of information extraction for knowledge base extension should take into account heterogeneous characteristics of source-specific document types. The proposed methodology proved to extract information effectively from various types of unstructured documents compared to the baseline model. There is a limitation in previous research that the performance is poor when extracting information about the document type that is different from the training data. In addition, this study can prevent unnecessary information extraction attempts from the documents that do not include the answer information through the process for predicting the suitability of information extraction of documents and sentences before the information extraction step. It is meaningful that we provided a method that precision performance can be maintained even in actual web environment. The information extraction problem for the knowledge base expansion has the characteristic that it can not guarantee whether the document includes the correct answer because it is aimed at the unstructured document existing in the real web. When the question answering is performed on a real web, previous machine reading comprehension studies has a limitation that it shows a low level of precision because it frequently attempts to extract an answer even in a document in which there is no correct answer. The policy that predicts the suitability of document and sentence information extraction is meaningful in that it contributes to maintaining the performance of information extraction even in real web environment. The limitations of this study and future research directions are as follows. First, it is a problem related to data preprocessing. In this study, the unit of knowledge extraction is classified through the morphological analysis based on the open source Konlpy python package, and the information extraction result can be improperly performed because morphological analysis is not performed properly. To enhance the performance of information extraction results, it is necessary to develop an advanced morpheme analyzer. Second, it is a problem of entity ambiguity. The information extraction system of this study can not distinguish the same name that has different intention. If several people with the same name appear in the news, the system may not extract information about the intended query. In future research, it is necessary to take measures to identify the person with the same name. Third, it is a problem of evaluation query data. In this study, we selected 400 of user queries collected from SK Telecom 's interactive artificial intelligent speaker to evaluate the performance of the information extraction system. n this study, we developed evaluation data set using 800 documents (400 questions * 7 articles per question (1 Wikipedia, 3 Naver encyclopedia, 3 Naver news) by judging whether a correct answer is included or not. To ensure the external validity of the study, it is desirable to use more queries to determine the performance of the system. This is a costly activity that must be done manually. Future research needs to evaluate the system for more queries. It is also necessary to develop a Korean benchmark data set of information extraction system for queries from multi-source web documents to build an environment that can evaluate the results more objectively.
본 웹사이트에 게시된 이메일 주소가 전자우편 수집 프로그램이나
그 밖의 기술적 장치를 이용하여 무단으로 수집되는 것을 거부하며,
이를 위반시 정보통신망법에 의해 형사 처벌됨을 유념하시기 바랍니다.
[게시일 2004년 10월 1일]
이용약관
제 1 장 총칙
제 1 조 (목적)
이 이용약관은 KoreaScience 홈페이지(이하 “당 사이트”)에서 제공하는 인터넷 서비스(이하 '서비스')의 가입조건 및 이용에 관한 제반 사항과 기타 필요한 사항을 구체적으로 규정함을 목적으로 합니다.
제 2 조 (용어의 정의)
① "이용자"라 함은 당 사이트에 접속하여 이 약관에 따라 당 사이트가 제공하는 서비스를 받는 회원 및 비회원을
말합니다.
② "회원"이라 함은 서비스를 이용하기 위하여 당 사이트에 개인정보를 제공하여 아이디(ID)와 비밀번호를 부여
받은 자를 말합니다.
③ "회원 아이디(ID)"라 함은 회원의 식별 및 서비스 이용을 위하여 자신이 선정한 문자 및 숫자의 조합을
말합니다.
④ "비밀번호(패스워드)"라 함은 회원이 자신의 비밀보호를 위하여 선정한 문자 및 숫자의 조합을 말합니다.
제 3 조 (이용약관의 효력 및 변경)
① 이 약관은 당 사이트에 게시하거나 기타의 방법으로 회원에게 공지함으로써 효력이 발생합니다.
② 당 사이트는 이 약관을 개정할 경우에 적용일자 및 개정사유를 명시하여 현행 약관과 함께 당 사이트의
초기화면에 그 적용일자 7일 이전부터 적용일자 전일까지 공지합니다. 다만, 회원에게 불리하게 약관내용을
변경하는 경우에는 최소한 30일 이상의 사전 유예기간을 두고 공지합니다. 이 경우 당 사이트는 개정 전
내용과 개정 후 내용을 명확하게 비교하여 이용자가 알기 쉽도록 표시합니다.
제 4 조(약관 외 준칙)
① 이 약관은 당 사이트가 제공하는 서비스에 관한 이용안내와 함께 적용됩니다.
② 이 약관에 명시되지 아니한 사항은 관계법령의 규정이 적용됩니다.
제 2 장 이용계약의 체결
제 5 조 (이용계약의 성립 등)
① 이용계약은 이용고객이 당 사이트가 정한 약관에 「동의합니다」를 선택하고, 당 사이트가 정한
온라인신청양식을 작성하여 서비스 이용을 신청한 후, 당 사이트가 이를 승낙함으로써 성립합니다.
② 제1항의 승낙은 당 사이트가 제공하는 과학기술정보검색, 맞춤정보, 서지정보 등 다른 서비스의 이용승낙을
포함합니다.
제 6 조 (회원가입)
서비스를 이용하고자 하는 고객은 당 사이트에서 정한 회원가입양식에 개인정보를 기재하여 가입을 하여야 합니다.
제 7 조 (개인정보의 보호 및 사용)
당 사이트는 관계법령이 정하는 바에 따라 회원 등록정보를 포함한 회원의 개인정보를 보호하기 위해 노력합니다. 회원 개인정보의 보호 및 사용에 대해서는 관련법령 및 당 사이트의 개인정보 보호정책이 적용됩니다.
제 8 조 (이용 신청의 승낙과 제한)
① 당 사이트는 제6조의 규정에 의한 이용신청고객에 대하여 서비스 이용을 승낙합니다.
② 당 사이트는 아래사항에 해당하는 경우에 대해서 승낙하지 아니 합니다.
- 이용계약 신청서의 내용을 허위로 기재한 경우
- 기타 규정한 제반사항을 위반하며 신청하는 경우
제 9 조 (회원 ID 부여 및 변경 등)
① 당 사이트는 이용고객에 대하여 약관에 정하는 바에 따라 자신이 선정한 회원 ID를 부여합니다.
② 회원 ID는 원칙적으로 변경이 불가하며 부득이한 사유로 인하여 변경 하고자 하는 경우에는 해당 ID를
해지하고 재가입해야 합니다.
③ 기타 회원 개인정보 관리 및 변경 등에 관한 사항은 서비스별 안내에 정하는 바에 의합니다.
제 3 장 계약 당사자의 의무
제 10 조 (KISTI의 의무)
① 당 사이트는 이용고객이 희망한 서비스 제공 개시일에 특별한 사정이 없는 한 서비스를 이용할 수 있도록
하여야 합니다.
② 당 사이트는 개인정보 보호를 위해 보안시스템을 구축하며 개인정보 보호정책을 공시하고 준수합니다.
③ 당 사이트는 회원으로부터 제기되는 의견이나 불만이 정당하다고 객관적으로 인정될 경우에는 적절한 절차를
거쳐 즉시 처리하여야 합니다. 다만, 즉시 처리가 곤란한 경우는 회원에게 그 사유와 처리일정을 통보하여야
합니다.
제 11 조 (회원의 의무)
① 이용자는 회원가입 신청 또는 회원정보 변경 시 실명으로 모든 사항을 사실에 근거하여 작성하여야 하며,
허위 또는 타인의 정보를 등록할 경우 일체의 권리를 주장할 수 없습니다.
② 당 사이트가 관계법령 및 개인정보 보호정책에 의거하여 그 책임을 지는 경우를 제외하고 회원에게 부여된
ID의 비밀번호 관리소홀, 부정사용에 의하여 발생하는 모든 결과에 대한 책임은 회원에게 있습니다.
③ 회원은 당 사이트 및 제 3자의 지적 재산권을 침해해서는 안 됩니다.
제 4 장 서비스의 이용
제 12 조 (서비스 이용 시간)
① 서비스 이용은 당 사이트의 업무상 또는 기술상 특별한 지장이 없는 한 연중무휴, 1일 24시간 운영을
원칙으로 합니다. 단, 당 사이트는 시스템 정기점검, 증설 및 교체를 위해 당 사이트가 정한 날이나 시간에
서비스를 일시 중단할 수 있으며, 예정되어 있는 작업으로 인한 서비스 일시중단은 당 사이트 홈페이지를
통해 사전에 공지합니다.
② 당 사이트는 서비스를 특정범위로 분할하여 각 범위별로 이용가능시간을 별도로 지정할 수 있습니다. 다만
이 경우 그 내용을 공지합니다.
제 13 조 (홈페이지 저작권)
① NDSL에서 제공하는 모든 저작물의 저작권은 원저작자에게 있으며, KISTI는 복제/배포/전송권을 확보하고
있습니다.
② NDSL에서 제공하는 콘텐츠를 상업적 및 기타 영리목적으로 복제/배포/전송할 경우 사전에 KISTI의 허락을
받아야 합니다.
③ NDSL에서 제공하는 콘텐츠를 보도, 비평, 교육, 연구 등을 위하여 정당한 범위 안에서 공정한 관행에
합치되게 인용할 수 있습니다.
④ NDSL에서 제공하는 콘텐츠를 무단 복제, 전송, 배포 기타 저작권법에 위반되는 방법으로 이용할 경우
저작권법 제136조에 따라 5년 이하의 징역 또는 5천만 원 이하의 벌금에 처해질 수 있습니다.
제 14 조 (유료서비스)
① 당 사이트 및 협력기관이 정한 유료서비스(원문복사 등)는 별도로 정해진 바에 따르며, 변경사항은 시행 전에
당 사이트 홈페이지를 통하여 회원에게 공지합니다.
② 유료서비스를 이용하려는 회원은 정해진 요금체계에 따라 요금을 납부해야 합니다.
제 5 장 계약 해지 및 이용 제한
제 15 조 (계약 해지)
회원이 이용계약을 해지하고자 하는 때에는 [가입해지] 메뉴를 이용해 직접 해지해야 합니다.
제 16 조 (서비스 이용제한)
① 당 사이트는 회원이 서비스 이용내용에 있어서 본 약관 제 11조 내용을 위반하거나, 다음 각 호에 해당하는
경우 서비스 이용을 제한할 수 있습니다.
- 2년 이상 서비스를 이용한 적이 없는 경우
- 기타 정상적인 서비스 운영에 방해가 될 경우
② 상기 이용제한 규정에 따라 서비스를 이용하는 회원에게 서비스 이용에 대하여 별도 공지 없이 서비스 이용의
일시정지, 이용계약 해지 할 수 있습니다.
제 17 조 (전자우편주소 수집 금지)
회원은 전자우편주소 추출기 등을 이용하여 전자우편주소를 수집 또는 제3자에게 제공할 수 없습니다.
제 6 장 손해배상 및 기타사항
제 18 조 (손해배상)
당 사이트는 무료로 제공되는 서비스와 관련하여 회원에게 어떠한 손해가 발생하더라도 당 사이트가 고의 또는 과실로 인한 손해발생을 제외하고는 이에 대하여 책임을 부담하지 아니합니다.
제 19 조 (관할 법원)
서비스 이용으로 발생한 분쟁에 대해 소송이 제기되는 경우 민사 소송법상의 관할 법원에 제기합니다.
[부 칙]
1. (시행일) 이 약관은 2016년 9월 5일부터 적용되며, 종전 약관은 본 약관으로 대체되며, 개정된 약관의 적용일 이전 가입자도 개정된 약관의 적용을 받습니다.