Search Articles & Publications

Showing 36 articles found for "Normalisasi"

SENTIMENT ANALYSIS OF CUSTOMER REVIEWS ON E-COMMERCE APPLICATIONS: LAZADA, TOKOPEDIA, AND BLIBLI

Ihza, Andika, Arifin, Muhammad, Setiawan, Arif
Abstract: Abstract: The rapid growth of e-commerce in Indonesia has increased consumer interactions with digital platforms, particularly Lazada, Tokopedia, and Blibli, resulting in a large volume of customer reviews that reflect consumer… onsumer experiences and perceptions but have not been optimally utilized in business decision-making. The main issue addressed in this study is how to process customer review data to generate meaningful information regarding consumer opinions. This research aims to apply web scraping techniques to collect customer review data and conduct sentiment analysis to identify trends in consumer opinions across the three e-commerce platforms. The dataset consists of 3,000 customer reviews, with 1,000 reviews collected from each platform, covering aspects such as shopping experience, service quality, delivery process, and customer satisfaction. The research methodology includes data collection through web scraping, text preprocessing for data cleaning and normalization, sentiment analysis using machine learning approaches, and visualization of sentiment results. The findings indicate differences in the distribution of positive, negative, and neutral sentiments across platforms, reflecting variations in consumer experiences and service strategies. These results demonstrate that sentiment analysis based on customer reviews can serve as strategic input to improve service quality, business performance, and marketing strategies in Indonesia’s e-commerce sector.   Keywords: customer reviews; digital services; e-commerce; sentiment analysis; web scarping Abstrak: Pertumbuhan pesat e-commerce di Indonesia meningkatkan interaksi konsumen dengan platform digital, khususnya Lazada, Tokopedia, dan Blibli, yang menghasilkan ulasan pelanggan dalam jumlah besar sebagai cerminan pengalaman dan persepsi konsumen, namun belum dimanfaatkan secara optimal dalam pengambilan keputusan bisnis. Permasalahan utama penelitian ini adalah bagaimana mengolah data ulasan tersebut agar dapat memberikan informasi yang bermakna mengenai opini konsumen. Penelitian ini bertujuan menerapkan web scraping untuk mengumpulkan data ulasan pelanggan serta melakukan analisis sentimen guna mengidentifikasi tren opini konsumen pada ketiga platform e-commerce tersebut. Data yang digunakan berjumlah 3.000 ulasan pelanggan, dengan masing-masing platform diwakili oleh 1.000 ulasan yang mencakup pengalaman berbelanja, kualitas layanan, proses pengiriman, dan tingkat kepuasan pelanggan. Metode penelitian meliputi pengambilan data menggunakan web scraping, pra-pemrosesan teks untuk pembersihan dan normalisasi data, analisis sentimen dengan pendekatan pembelajaran mesin, serta visualisasi hasil sentimen. Hasil penelitian menunjukkan adanya perbedaan distribusi sentimen positif, negatif, dan netral pada setiap platform, yang mencerminkan variasi pengalaman konsumen dan strategi layanan. Temuan ini menunjukkan bahwa analisis sentimen berbasis ulasan pelanggan dapat menjadi masukan strategis untuk meningkatkan kualitas layanan, kinerja bisnis, dan strategi pemasaran e-commerce di Indonesia.   Kata kunci: customer reviews; digital services;e-commerce;sentiment analysis;web scarping

COMPARATIVE ANALYSIS OF RANDOM FOREST, KNN, AND SVM FOR TODDLER STUNTING CLASSIFICATION

Shula, Maritza Ayu, Sri Siswanti
Abstract: Abstract: Stunting is a chronic nutritional condition in toddlers characterized by a Height-for-Age (HFA) measurement below the standard growth threshold, necessitating early detection to prevent long-term consequences.… This study aims to classify toddler stunting status by comparing three machine learning methods: Random Forest (RF), K-Nearest Neighbor (KNN), and Support Vector Machine (SVM). The dataset comprises 345 toddler records from Puskesmas Indramayu (2025), including weight, height, and nutritional status based on WFA, HFA, and WFH indicators. Preprocessing steps include data cleaning, StandardScaler normalization, One-Hot Encoding for categorical features, and splitting the training and testing data with a ratio of 80:20. The comparison results are that KNN achieved the best performance with an accuracy of 71.01%, a precision of 0.69, a recall of 0.69, and an F1 score of 0.67, while RF and SVM both had an accuracy of 69.57% with F1 scores of 0.67 and 0.68, respectively. Thus, KNN demonstrated superior effectiveness in classifying the stunting status of toddlers compared to RF and SVM on this dataset.             Keywords: KNN; Random Forest; SVM; Stunting; toddlers     Abstract: Stunting adalah kondisi gizi kronis pada balita yang ditandai dengan pengukuran Tinggi Badan menurut Usia (HFA) di bawah ambang batas pertumbuhan standar, sehingga memerlukan deteksi dini untuk mencegah konsekuensi jangka panjang. Penelitian ini bertujuan untuk mengklasfikasikan status stunting pada balita dengan membandingkan tiga metode pembelajaran mesin: Random Forest (RF), K-Nearest Neighbor (KNN), dan Support Vector Machine (SVM). Kumpulan data terdiri dari 345 catatan balita dari puskesmas indramayu (2025), termaksut brat badan, tinggi badan, dan status gizi berdasarkan indicator WFA, HFA, dan WFH. Langkah-langkah prapemrosesan meliputi pembersian data, normalisasi Stand-ardScaler, One-Hot Encoding untuk fitur kategirikal, serta pembagian data pelatihan dan pengujian dengan rasio 80:20. Hasil perbadingan adalah KNN mencapai kinerja terbaik dengan akurasi 71,01%, presisi 0,69, recall 0,69, dan skor F1 sebesar 0,67,  RF dan SVM  keduanya memiliki akurasi 69,57% dengan skor F1 masing-masing sebesar 0,67 dan 0,68. Dengan demikian, KNN menunjukkan keefektifan yang lebih unggul dalam mengklasifikasikan status stunting balita dibandingkan dengan RF dan SVM pada da-taset ini.   Kata kunci: KNN; random forest; SVM; Stunting; Balita

STOCK PRICE PREDICTION FOR MATERIALS SECTOR USING CNN AND BI-LSTM ALGORITHM

Annisa Desianty, Widang Muttaqin
Abstract: Abstract: The materials sector is one of the stock markets sectors that attracts investors due to the high level of construction activity in Indonesia, which supports long-term growth. Stock price movements are influenced… d by various factors, requiring investors to determine the appropriate timing for buying, selling, or holding stocks. Therefore, this study aims to predict stock prices in the materials sector using a combination of CNN–BiLSTM algorithms. The research data were obtained from Yahoo Finance and processed through min–max normalization, data splitting, sliding window, model implementation, and evaluation stages. Testing was conducted on INTP and SMGR stocks with data split scenarios ranging from 60:40 to 90:10. The results show that CNN–BiLSTM performs best with a 90:10 data split, with minimum MSE and MAPE values of 0.000153 and 2.471% for INTP, and 0.000199 and 2.208% for SMGR, respectively. These findings indicate that increasing the proportion of training data improves the model's ability to learn historical patterns and produce more stable predictions. Keywords: CNN-BILSTM; materials sector; stock   Abstrak: Sektor materials merupakan salah satu sektor saham yang diminati investor karena tingginya aktivitas pembangunan di Indonesia yang mendorong pertumbuhan jangka panjang. Pergerakan harga saham dipengaruhi oleh berbagai faktor sehingga investor perlu menentukan waktu transaksi yang tepat. Oleh karena itu, penelitian ini bertujuan memprediksi harga saham sektor materials menggunakan kombinasi algoritma CNN–BiLSTM. Data penelitian diperoleh dari Yahoo Finance dan diproses melalui tahapan normalisasi min–max, pembagian data, sliding window, implementasi model, serta evaluasi. Pengujian dilakukan pada saham INTP dan SMGR dengan skenario pembagian data 60:40 hingga 90:10. Hasil menunjukkan bahwa CNN–BiLSTM menghasilkan performa terbaik pada pembagian data 90:10, dengan nilai MSE dan MAPE minimum masing-masing sebesar 0.000153 dan 2.471% untuk INTP, serta 0.000199 dan 2.208% untuk SMGR. Temuan ini mengindikasikan bahwa peningkatan porsi data latih meningkatkan kemampuan model dalam mempelajari pola historis dan menghasilkan prediksi yang lebih stabil. Kata kunci: CNN-BILSTM; saham; sektor materials

COMPARISON OF RESNET-50 AND DENSENET-121 CNNARCHITECTURES FOR MALARIA IMAGE CLASSIFICATION

Prayatna, Betantiyo, Budi, Kurnia, Fachruddin, Fachruddin
Abstract: Abstract: Malaria remains a major global health problem, particularly in tropical countries such as Indonesia. Accurate early diagnosis is essential for reducing malaria-related morbidity and mortality. Conventional microscopic… oscopic examination is time-consuming, highly dependent on expert personnel, and prone to human error. This study compares the performance of two Convolutional Neural Network (CNN) architectures, ResNet-50 and DenseNet-121, for malaria image classification. The Cell Images for Malaria dataset provided by the National Institutes of Health (NIH) through Kaggle was used, consisting of 27,558 microscopic blood cell images categorized into Parasitized and Uninfected classes. The dataset was divided into 80% training data and 20% testing data. Image preprocessing included resizing to 224 × 224 pixels, normalization, labeling, and data augmentation using RandomFlip, RandomRotation, RandomZoom, and RandomContrast. Experimental results showed that the ResNet-50 model trained for 100 epochs achieved the highest performance, with an accuracy of 95.54% and precision, recall, and F1-score of 0.96. The confusion matrix indicated 5,272 correctly classified images out of 5,510 testing samples. These findings demonstrate that ResNet-50 outperformed DenseNet-121 and has strong potential for supporting accurate, reliable, and efficient computer-aided malaria diagnosis based on microscopic blood smear images.   Keywords: computer-aided diagnosis; convolutional neural network (CNN); densenet-121; early detection; image classification; malaria; microscopic blood smear images; resnet-50;     Abstrak : Malaria masih menjadi masalah kesehatan global yang serius, terutama di negara tropis seperti Indonesia. Diagnosis dini yang akurat sangat penting untuk menurunkan angka morbiditas dan mortalitas. Metode konvensional berupa pemeriksaan mikroskopis memiliki keterbatasan karena memerlukan waktu yang relatif lama, bergantung pada tenaga ahli, dan berpotensi menimbulkan kesalahan manusia. Penelitian ini bertujuan membandingkan kinerja arsitektur Convolutional Neural Network (CNN) yaitu ResNet-50 dan DenseNet-121 dalam klasifikasi citra malaria. Dataset yang digunakan berasal dari Cell Images for Malaria yang disediakan oleh National Institutes of Health (NIH) melalui platform Kaggle, terdiri dari 27.558 citra dengan pembagian 80% data latih, 20% data validasi. Tahap praproses meliputi cleaning, resizing citra menjadi 224×224 piksel, normalisasi, labeling, serta data augmentasi menggunakan RandomFlip, RandomRotation, RandomZoom, dan RandomContrast. Hasil pengujian menunjukkan bahwa model ResNet-50 pada epoch 100 memperoleh akurasi sebesar 95,54% dengan nilai precision, recall, dan F1-score masing-masing sebesar 0,96. Confusion matrix menunjukkan jumlah prediksi benar sebanyak 5.272 dari total 5.510 data uji. Hasil ini menunjukkan bahwa arsitektur CNN mampu mengklasifikasikan citra malaria dengan tingkat akurasi yang tinggi dan memiliki kemampuan generalisasi yang baik terhadap data baru. Penelitian ini memberikan kontribusi dalam evaluasi performa arsitektur CNN untuk mendukung pengembangan sistem diagnosis malaria berbasis citra mikroskopis yang lebih cepat dan akurat.   Kata kunci: convolutional neural network (CNN); citra mikroskopis hapusan darah; densenet-121; diagnosis berbantuan komputer; deteksi dini; klasifikasi citra; malaria; resnet-50

NAÏVE BAYES-BASED STUDENT ACHIEVEMENT PREDICTION SYSTEM

Angreani, Fadillah, Pratiwi, Heny, Saad, Muhammad Ibnu
Abstract: Abstract: SMP Muhammadiyah 5 Samarinda still relies on manual evaluation with limited data analysis tools in predicting student academic achievement. This study aims develop a system for predicting the learning achievement… nt of students at SMP Muhammadiyah 5 Samarinda using the Naive Bayes classification method. The dataset used consists of 192 student exam scores covering academic scores, attendance, parents’ education and income, and living conditions as independent variables, while the dependent variable is the achievement label (achieved or not achieved). The preprocessing stage includes label normalization, feature selection, and median imputation to handle missing data. The dataset was divided into 75% training data and 25%. The model was implemented as a pipeline consisting of a median imputer and a Gaussian Naive Bayes classifier. The evaluation results showed that the model achieved an accuracy of 79.2%, with a perfect recall value (1.00) in the high-achieving class and (0.64) in the low-achieving class. This shows that the model is quite effective in identifying high-achieving students. The trained model was then integrated into a Flask-based web application, which enables online predictions through a simple form interface, facilitating contextual interpretation. This system is expected to assist in educational decision-making by helping teachers identify students’ achievement levels early on and design more targeted learning interventions. Keywords: academic performance; educational data mining; naive bayes; prediction system; student achievement     Abstrak: SMP Muhammadiyah 5 Samarinda masih bergantung pada evaluasi manual dengan  alat analisis data terbatas dalam melakukan prediksi prestasi akademik siswa. Penelitian ini bertujuan mengembangkan sistem prediksi prestasi belajar siswa SMP Muhammadiyah 5 Samarinda menggunakan metode klasifikasi Naive Bayes. Dataset yang digunakan terdiri atas 192 data nilai ujian siswa yang mencakup skor akademik, kehadiran, pendidikan dan pendapatan orang tua, serta kondisi tempat tinggal sebagai variabel independen, sedangkan variabel dependen berupa label prestasi (berprestasi atau tidak berprestasi). Tahap preprocessing meliputi normalisasi label, seleksi fitur, serta imputasi median untuk menangani data yang hilang. Dataset dibagi menjadi 75% data latih dan 25%. Model diimplementasikan dalam bentuk pipeline yang terdiri atas median imputer dan Gaussian Naive Bayes classifier. Hasil evaluasi menunjukkan bahwa model mencapai akurasi sebesar 79,2%, dengan nilai recall sempurna (1,00) pada kelas berprestasi dan lebih rendah (0,64) pada kelas tidak berprestasi. Hal ini menunjukkan bahwa model cukup efektif dalam mengidentifikasi siswa berprestasi. Model yang telah dilatih kemudian diintegrasikan ke dalam aplikasi web berbasis Flask, yang memungkinkan prediksi secara daring melalui antarmuka formulir sederhana untuk mendukung interpretasi kontekstual. Sistem ini diharapkan dapat membantu untuk pengambilan keputusan dalam pendidikan dengan membantu guru mengidentifikasi tingkat prestasi siswa sejak dini dan merancang intervensi pembelajaran yang lebih terarah.   Kata kunci: prestasi akademik; penambangan data Pendidikan; naive bayes; sistem prediksi; prestasi siswa

COMPARISON SVM, RF, BERT PUBLIC SENTIMENT DATA MBG IN X

Gustri Efendi, Yandi, Rus, Aprilia, Rani, Amaroh Bit Taqwa, Irvan
Abstract: Abstract: MBG is a strategic program of the Prabowo-Gibran administration. This program has become a widely discussed issue in the public. To better understand public perception of this program, sentiment analysis is necessary.… essary. This study aims to compare the performance of algorithms machine learning SVM, RF, And BERT with preprocessing data analyzing public sentiment of the MBG program in media X. The total dataset for this study was 39,858 out of 42,465 successfully crawled tweets. The research methods included data collection, preprocessing data (cleaning, case folding, word normalization, stopword removal and stemming), feature extraction, model training (fine-tuning), handling class imbalance with SMOTE, and evaluation using accuracy, precision, recall, and f1-score. The research results show that without SMOTE, the best performing models are BERT with 89% accuracy, SVM 87%, and RF 78.4%. After SMOTE, the best algorithms were SVM with 92.94%, BERT with 88.3%, and RF with 86.59%. The results confirmed that SVM is the best algorithm if at leastclass imbalance. BERT is the best algorithm before and after SMOTE, because BERT is more effective in capturing the nuances of language on social media, so BERT is the most recommended in MBG sentiment analysis.             Keywords: sentiment analysis; machine learning; SVM, RF, and BERT   Abstrak: MBG merupakan program strategis pemerintahan Prabowo - Gibran. Program ini menjadi isu yang banyak diperbincangkan publik. Untuk mengetahui lebih dalam persepsi masyrakat tentang program ini, perlu dilakukan analisis sentiment. Penelitian ini bertujuan membandingkan kinerja algoritma machine learning SVM, RF, dan BERT dengan preprocessing data menganalisis sentiment public program MBG di media X. Total dataset penelitian ini adalah 39.858 dari 42.465 tweet yang berhasil di crawling. Metode penelitian mencakup pengumpulan data, preprocessing data (cleaning, case folding, normalisasi kata, stopword removal dan stemming), ekstraksi fitur, pelatihan model (fine-tuning), penanganan class imbalance dengan SMOTE, dan evaluasi menggunakan akurasi, presisi, recall, dan f1-score. Hasil peneltian menunjukkan, tanpa SMOTE model dengan kinerja terbaik adalah BERT dengan akurasi 89%, SVM 87%, dan RF 78,4%. Setelah SMOTE algoritma terbaik adalah SVM 92,94%, BERT 88,3% dan RF 86,59%. Hasil penelitian menegaskan bahwa SVM adalah algoritma terbaik jika minimal class imbalance. BERT adalah algoritma terbaik sebelum dan sesudah SMOTE, karena BERT lebih efektif dalam menangkap nuansa bahasa pada media sosial, sehingga BERT paling di rekomendasikan dalam analisis sentimen MBG.   Kata kunci: analisis sentimen; machine learning; SVM, RF, dan BERT

PREDICTION OF STROKE USING LOGISTIC REGRESSION WITH A MACHINE LEARNING APPROACH

Rana Aphrodita, Ishiqa, Nur Fajri, Ika, Nugroho, Agung
Abstract: Abstract: Stroke is one of the leading causes of death and disability in various parts of the world, including in Indonesia. Along with the development of digital technology, the use of Machine Learning in the health sector… tor is growing, one of which is in an effort to predict the occurrence of stroke. This study aims to implement the Logistic Regression algorithm in predicting the likelihood of a person having a stroke based on data from the Brain Stroke dataset. The research process includes data preprocessing (missing value handling, normalization, and label encoding), dividing the data into 80% training data and 20% test data, as well as model training. The model was then evaluated using several measures such as accuracy, precision, recall, F1-score, and ROC-AUC, as well as a confusion matrix. The results of the study showed that Logistic Regression was able to provide stroke classification results with an accuracy of 82.4%, precision of 80.1%, recall of 78.6%, F1-score of 79.3%, and a ROC-AUC value of 0.87. Then, the model is integrated into applications that use Streamlit, so it can be used interactively to predict stroke risk in new data. The results of this study show that the combination of Machine Learning and web-based applications has the potential to support efforts to detect early stroke risk.             Keywords: logistic regression; machine learning; prediction; streamlit; stroke.     Abstrak: Stroke adalah salah satu penyebab utama kematian dan kecacatan di berbagai belahan dunia, termasuk di Indonesia. Seiring perkembangan teknologi digital, penggunaan Machine Learning dalam bidang kesehatan semakin berkembang, salah satunya dalam upaya memprediksi terjadinya penyakit stroke. Penelitian ini bertujuan untuk mengimplementasikan algoritma Logistic Regression dalam memprediksi kemungkinan seseorang mengalami stroke berdasarkan data dari dataset Brain Stroke. Proses penelitian meliputi preprocessing data (penanganan missing value, normalisasi, dan label encoding), membagi data menjadi 80% data latih dan 20% data uji, serta pelatihan model. Model kemudian dievaluasi menggunakan beberapa ukuran seperti akurasi, precision, recall, F1-score, dan ROC-AUC, serta confusion matrix. Hasil penelitian menunjukkan bahwa Logistic Regression mampu memberikan hasil klasifikasi penyakit stroke dengan akurasi sebesar 82,4%, precision 80,1%, recall 78,6%, F1-score 79,3%, dan nilai ROC-AUC sebesar 0,87. Kemudian, model tersebut diintegrasikan ke dalam aplikasi yang menggunakan Streamlit, sehingga dapat digunakan secara interaktif untuk memprediksi risiko stroke pada data baru. Hasil penelitian ini menunjukkan bahwa kombinasi Machine Learning dan aplikasi berbasis web berpotensi mendukung upaya deteksi dini risiko stroke.   Kata kunci: logistic regression; machine learning; prediksi; streamlit; stroke.

OPTIMIZATION OF SUPPORT VECTOR MACHINE WITH SMOTE AND BAYESIAN METHOD FOR HEART FAILURE CLASSIFICATION

Doni Agung Prasetyo, Harminto Mulyo, Nadia Annisa Maori
Abstract: Abstract: This study applies an integrated approach to optimize heart failure classification. The main objective is to address the challenge of class imbalance in medical datasets and to improve the accuracy, sensitivity,… , and generalization of the classification model. The urgency of this issue is emphasized by statistics showing that cardiovascular diseases cause approximately 17.9 million deaths worldwide each year. Using a quantitative experimental approach, this study analyzes the "Heart Failure Prediction Dataset" from Kaggle, which consists of 918 records. The data were processed through normalization and encoding, followed by the application of SMOTE on the training set to balance class distribution. This step successfully increased model accuracy from 88.41% to 90.22% and minority class recall from 0.82 to 0.88. Furthermore, Bayesian Optimization was employed to refine the hyperparameters of SVM, resulting in a final model with an accuracy of 89.13% that demonstrated better generalization. This integrated approach significantly enhances the stability, sensitivity, and generalization of the model, making it a reliable tool for clinical decision support systems in predicting heart failure.   Keywords: bayesian optimization; heart failure; machine learning; SMOTE; SVM.   Abstrak: Penelitian ini menerapkan pendekatan terintegrasi untuk mengoptimalkan klasifikasi gagal jantung. Tujuan utama studi ini adalah untuk mengatasi tantangan ketidakseimbangan kelas dalam dataset medis dan meningkatkan akurasi, sensitivitas, serta generalisasi model klasifikasi. Urgensi ini ditegaskan oleh statistik yang menunjukkan bahwa penyakit kardiovaskular menyebabkan sekitar 17,9 juta kematian setiap tahun secara global. Menggunakan pendekatan eksperimental kuantitatif, penelitian ini menganalisis "Heart Failure Prediction Dataset" dari Kaggle, yang terdiri dari 918 catatan. Data diproses dengan normalisasi dan encoding, lalu SMOTE diterapkan pada data pelatihan untuk menyeimbangkan distribusi kelas. Langkah ini berhasil meningkatkan akurasi dari 88,41% menjadi 90,22% dan recall kelas minoritas dari 0,82 menjadi 0,88. Selanjutnya, Bayesian Optimization menyempurnakan hyperparameter SVM, menghasilkan model akhir dengan akurasi 89,13% yang menunjukkan generalisasi lebih baik. Pendekatan terintegrasi ini secara signifikan meningkatkan stabilitas, sensitivitas, dan generalisasi model. Hasil penelitian ini menjadikannya alat yang andal untuk sistem pendukung keputusan klinis dalam prediksi gagal jantung. Kata kunci: bayesian optimization; gagal jantung; machine learning; SMOTE; SVM

PERFORMANCE ANALYSIS OF CLUSTERING MODELS BASED ON MACHINE LEARNING IN STUNTING DATA MAPPING

Handayani, Masitah, Sibuea, Mustika Fitri Larasati
Abstract: Abstract: Stunting is one of the nutritional problems that the world pays the most attention to and a major nutritional problem in Indonesia. Stunting is a problem in toddler growth which is characterized by a toddler's… height that is too short compared to toddlers of his age. In the research location, namely Asahan Regency, the mapping of areas prone to increased stunting rates has not been carried out optimally. The process of exploring the stunting data warehouse is useful for adding information that can assist the government in making policies. Therefore, the aim of this research is to map stunting-prone areas in Asahan district based on the number of stunting cases in Asahan district using the machine learning-based K-Means clustering model. Based on previous research reviews, the k-means clustering method used has not used the normalization process. In addition, distance measurement only uses Euclidean Distance. Meanwhile, in this research, clustering performance analysis was carried out using a more in-depth process, namely by applying data normalization at the beginning, using the elbow method to determine the best number of clusters (K), measuring distance using Euclidean Distance, Manhattan Distance and Minkowski Distance to obtain comparison results. better clusters. The analysis results show that the best number of clusters is cluster 2 which shows the mapping results into 2 groups with a DBI of 0.51290 and a silhouette_score of 0.71432.   Keywords: stunting; k-means clustering; machine learning   Abstrak: Stunting menjadi salah satu permasalahan gizi yang paling diperhatikan dunia dan permasalahan gizi yang utama di Indonesia. Stunting merupakan masalah pada pertumbuhan balita yang ditandai dengan tinggi badan balita yang terlalu pendek dibanding balita seusianya. Pada lokasi penelitian yaitu Kabupaten Asahan, pemetaan daerah rawan peningkatan angka stunting belum dilakukan dengan optimal. Proses eksplorasi gudang data stunting ini berguna untuk menambah informasi yang dapat membantu pemerintah dalam mengambil kebijakan. Maka dari itu, tujuan dari penelitian ini adalah pemetaan daerah rawan stunting di kabupaten Asahan berdasarkan jumlah kasus stunting di Kabupaten Asahan menggunakan model clustering metode K-Means berbasis machine learning. Berdasarkan tinjauan penelitian terdahulu, metode k-means clustering yang digunakan belum menggunakan proses normalisasi. Selain itu, pengukuran jarak hanya menggunakan Euclidean Distance. Sedangkan dalam penelitian ini, analisis kinerja clustering yang dilakukan dengan proses yang lebih mendalam yaitu dengan penerapan normalisasi data di awal, penggunaan elbow method untuk penentuan jumlah cluster (K) terbaik, pengukuran jarak dengan Euclidean Distance, Manhattan Distance dan Minkowski Distance untuk mendapatkan hasil perbandingan cluster yang lebih baik. Hasil analisis menunjukkan bahwa jumlah cluster terbaik yaitu  cluster 2 yang menunjukkan hasil pemetaan menjadi 2 kelompok dengan DBI 0.51290 dan silhouette_score sebesar 0.71432.   Kata kunci: stunting; k-means clustering; machine learning

BACKPROPAGATION METHOD TO PREDICT RAINFALL LEVELS IN ROKAN HULU DISTRICT

Andrianto, Richi, Irawan, Feri, Purnomo, Nopi, Rahayu Putri, Perra Budiarti
Abstract: Abstract: Rokan Hulu Regency is one of the regencies in Riau Province and has 2 large rivers, namely the Rokan Kanan River and the Rokan Kiri River. When the level of rainfall is high, the river flow overflows and causes… flooding in several sub-districts. Climate change that is happening has an impact on changes in rainfall patterns, to overcome the impacts of climate change Rokan Hulu Regency needs to take early steps before a flood disaster occurs. The method used in processing the data is the backpropagation method and data processing using the Matlab software. Data processing was carried out on rainfall data for the last 6 years, from 2015 to 2020, which was sourced from the Rokan Hulu Regency Statistics Agency. Rainfall data from 2015 to 2019 is used as input data, while 2020 is the target. The data processing stage begins with data normalization and determining network training parameters. Artificial neural network research was carried out on rainfall data with a 5-5-1 architecture. The results of testing the rainfall data show prediction results with high accuracy, where the average accuracy rate reaches 98.17% with the highest accuracy of 99.99% while the lowest accuracy is 91.53%. The prediction results show a fairly high level of accuracy so that they can be used as evaluation material.             Keywords: artificial neural network; backpropagation; prediction; rainfall     Abstrak: Kabupaten Rokan Hulu merupakan salah satu kabupaten yang berada di Provinsi Riau dan memiliki 2 aliran sungai besar yaitu sungai rokan kanan dan sungai rokan kiri. Ketika tingkat curah hujan tinggi aliran sungai meluap dan menyebabkan banjir beberapa kecamatan. Perubahan iklim yang terjadi memberikan dampak pada perubahan pola curah hujan, untuk menanggulangi dampak perubahan iklim Kabupaten Rokan Hulu perlu melakukan langkah-langkah dini sebelum terjadi bencana banjir. Metode yang digunakan dalam mengolah data yaitu metode backpropagation dan pengolahan data menggunakan software Matlab. Pengolahan data dilakukan pada data curah hujan selama 6 tahun terakhir yaitu dari tahun 2015 sampai dengan 2020 yang bersumber dari Badan Statistik Kabupaten Rokan Hulu. Data curah hujan tahun 2015 sampai dengan tahun 2019 sebagai data input sedangkan tahun 2020 sebagai target. Tahapan pengolahan data diawali dengan melakukan normalisasi data dan menentukan parameter pelatihan jaringan. Penelitian jaringan saraf tiruan dilakukan pada data curah hujan dengan arsitekur 5-5-1. Hasil pengujian terhadap data curah hujan menunjukkan hasil prediksi dengan akurasi yang tinggi, dimana tingkat akurasi rata-rata mencapai 98,17% dengan akurasi tertinggi sebesar 99,99% sedang akurasi terendah sebesar 91,53%. Hasil prediksi menunjukkan tingkat akurasi yang cukup tinggi sehingga dapat digunakan sebagai bahan evaluasi.   Kata kunci: backpropagation; curah hujan; jaringan saraf tiruan; prediksi