Search Articles & Publications

Showing 104 articles found for "Machine"

INTELLIGENT DIGITAL FORENSICS FILE MANIPULATION DETECTION USING METADATA ANALYSIS AND RANDOM FOREST

Panggabean, Erwin Gabe, Perwira, Yuda, Parulian Sinaga, Dedi Candro, Lidia Lubis , Nur, Suheru, Muhammad
Abstract: Abstract: The advancement of digital technology has made it easier to create, process, and distribute files—using 317 files from the dataset https://www.kaggle.com/datasets/axon data/selfie-and-official-id-photo-dataset-18k… t-18k images?select=metadata_image.csv has also introduced new challenges, such as the increasing practice of digital file manipulation that is difficult to detect visually. Therefore, an intelligent digital forensics system that can automatically and accurately detect file authenticity is required. This study aims to develop an intelligent digital forensics system for detecting file manipulation by leveraging metadata analysis and the Random Forest classification method. The methods used include extracting metadata from digital files—such as time information, device details, and processing history—followed by analysis to identify patterns of inconsistency that indicate manipulation. This data is then used as features in the classification process using the Random Forest algorithm to distinguish between original and manipulated files. The results of this study are expected to show that the use of metadata analysis combined with the Random Forest algorithm can improve accuracy in detecting digital file manipulation compared to conventional methods. The resulting system is expected to provide an effective, efficient, and integrated solution to support digital forensic investigations, Based on the test results, the system demonstrated good performance with an accuracy rate of 94%.   Keywords: Digital Forensics;File Manipulation;Metadata Analysis;Random Forest;Classification;Machine Learning   Abstrak:Perkembangan teknologi digital telah meningkatkan kemudahan dalam pembuatan, pengolahan,dan distribusi file sebanyak 317 file, sumber datasets https:// www.kaggle.com/datasets/axondata/selfie-and-official-id-photo-dataset-18k-images?select =metadata_image.csv, namun juga menimbulkan tantangan baru berupa meningkatnya praktik manipulasi file digital yang sulit dideteksi secara kasat mata. Oleh karena itu, diperlukan suatu sistem forensik digital yang cerdas dan mampu mendeteksi keaslian file secara otomatis dan akurat. Penelitian ini bertujuan untuk mengembangkan sistem forensik digital cerdas untuk deteksi manipulasi file dengan memanfaatkan analisis metadata dan metode klasifikasi Random Forest. Metode yang digunakan meliputi proses ekstraksi metadata dari file digital, seperti informasi waktu, perangkat, dan riwayat pengolahan, kemudian dilakukan analisis untuk menemukan pola ketidaksesuaian yang mengindikasikan adanya manipulasi. Selanjutnya, data tersebut digunakan sebagai fitur dalam proses klasifikasi menggunakan algoritma Random Forest untuk membedakan antara file asli dan file yang telah dimanipulasi. Hasil dari penelitian ini diharapkan menunjukkan bahwa penggunaan analisis metadata yang dikombinasikan dengan algoritma Random Forest mampu meningkatkan akurasi dalam mendeteksi manipulasi file digital dibandingkan metode konvensional. Sistem yang dihasilkan dapat memberikan solusi yang efektif, efisien, dan terintegrasi dalam mendukung proses investigasi forensik digital, Berdasarkan hasil pengujian, sistem menunjukkan performa yang baik dengan tingkat akurasi sebesar 94%.   Kata Kunci: Forensik Digital, Manipulasi File, Metadata, Random Forest, Klasifikasi, Machine Learning.

A COMPARATIVE ANALYSIS OF MACHINE LEARNING ALGORITHMS AND USER EXPERIENCE FOR ACADEMIC PERFORMANCE PREDICTION

Tasril, Virdyra, Prayudani, Santi, Prayoga, J., Mayang Sari, Rahayu
Abstract: This study aimed to compare the performance of machine learning algorithms and user experience in predicting students’ academic achievement. The research is motivated by the need for prediction systems that are not only… y highly accurate but also easily interpretable by users. The proposed methodology involved the implementation of two algorithms, namely Decision Tree and Random Forest, using an academic dataset that included grade point average, attendance, and assessment scores. Model performance was evaluated using accuracy, precision, recall, and F1-score, while user experience was assessed through the System Usability Scale (SUS) based on a simple user interface. The findings revealed that Random Forest achieved higher predictive accuracy, whereas Decision Tree provided better interpretability and ease of understanding for users. These results indicated a trade-off between model performance and user experience, suggesting that algorithm selection should consider both aspects in order to develop an effective and user-friendly academic prediction system

MULTI VIEW FEATURE FUSION FOR INDUSTRIAL ANOMALY DETECTION USING 1D-CNN

Nainggolan, Daniel Fernando, Hiskiawan, Puguh
Abstract: Abstract: Anomalous sound detection is essential for industrial predictive maintenance, as machine failures often originate from subtle acoustic changes during operation. However, high background noise and limitations of… conventional Convolutional Neural Networks (CNN) reduce detection reliability. This study proposes a 1D-CNN-based anomaly detection framework with multi-view feature fusion and temporal segmentation to enhance detection performance. The approach combines MFCC, Log-Mel Spectrogram, and Chroma STFT features, while temporal segmentation divides audio signals into 5-second segments to better capture transient anomalies. Experiments on the MIMII dataset under varying Signal-to-Noise Ratio (SNR) conditions show that MFCC and Log-Mel fusion achieves the best performance, with 97.90% accuracy and ROC-AUC of 0.9789. The model maintains accuracy above 90% at −6 dB, demonstrating strong robustness in noisy industrial environments. Keywords: industrial anomaly detection; 1D-CNN; multi-view feature fusion; temporal segmentation; MIMII dataset.   Abstrak: Deteksi anomali suara merupakan komponen penting dalam sistem pemeliharaan prediktif industri, karena kegagalan mesin sering diawali oleh perubahan akustik yang bersifat halus selama proses operasi. Namun, tingkat kebisingan yang tinggi serta keterbatasan arsitektur Convolutional Neural Network (CNN) konvensional dapat menurunkan keandalan deteksi. Penelitian ini bertujuan mengusulkan kerangka deteksi anomali berbasis 1D-CNN yang mengintegrasikan strategi fusi fitur multi-view dan segmentasi temporal untuk meningkatkan kinerja deteksi. Pendekatan yang digunakan menggabungkan fitur MFCC, Log-Mel Spectrogram dan Chroma STFT, sementara teknik temporal splitting membagi sinyal audio menjadi segmen berdurasi 5 detik untuk menangkap anomali yang bersifat sementara. Eksperimen menggunakan dataset MIMII pada berbagai kondisi Signal-to-Noise Ratio (SNR) menunjukkan bahwa kombinasi MFCC dan Log-Mel Spectrogram menghasilkan kinerja terbaik dengan akurasi 97,90% dan ROC-AUC sebesar 0,9789. Model juga mempertahankan akurasi di atas 90% pada kondisi kebisingan ekstrem (−6 dB) yang menunjukkan ketahanan yang baik dalam lingkungan industri yang bising. Kata kunci: deteksi anomali industri; 1D-CNN; fusi fitur multi-view; segmentasi temporal; dataset MIMII

SENTIMENT ANALYSIS USING MACHINE LEARNING FOR DIGITAL SERVICE DEVELOPMENT

Balqis, Rugaiyah, Jahda Rusti Putri, Mira Afrina, Ibrahim, Ali, Fathoni, Fathoni
Abstract: Abstract: The rapid growth of e-commerce mobile applications has generated large volumes of user reviews, making manual sentiment analysis increasingly impractical. This study aims to compare the effectiveness of three machine… achine learning algorithms Support Vector Machine (SVM), Random Forest, and Naive Bayes for automated sentiment classification of Indonesian-language mobile application reviews. A dataset of 3,000 user reviews from the RupaRupa application on the Google Play Store was collected and preprocessed through normalization, tokenization, stopword removal, and stemming. TF-IDF vectorization was applied for feature extraction, while the Synthetic Minority Over-sampling Technique (SMOTE) was used to address class imbalance across three sentiment categories: positive, negative, and neutral. The results show that SVM achieved the highest accuracy of 90.02%, while Random Forest obtained the best F1-score of 88.08% when sufficient training data were available. Naive Bayes demonstrated relatively stable performance across varying training data sizes. Furthermore, TF-IDF keyword analysis revealed that negative reviews were primarily associated with delivery issues, technical problems, and pricing concerns. These findings demonstrate the effectiveness of machine learning approaches for sentiment classification and provide practical insights for improving mobile application services.   Keywords: sentiment analysis; machine learning; SMOTE; TF-IDF; text classification   Abstrak: Pertumbuhan pesat aplikasi mobile e-commerce telah menghasilkan volume ulasan pengguna yang sangat besar, sehingga analisis sentimen secara manual menjadi semakin tidak praktis. Penelitian ini bertujuan untuk membandingkan efektivitas tiga algoritma machine learning Support Vector Machine (SVM), Random Forest, dan Naive Bayes dalam melakukan klasifikasi sentimen otomatis terhadap ulasan aplikasi mobile berbahasa Indonesia. Dataset yang digunakan terdiri dari 3.000 ulasan pengguna aplikasi RupaRupa yang dikumpulkan dari Google Play Store. Data kemudian diproses melalui tahapan preprocessing yang meliputi normalisasi, tokenisasi, penghapusan stopword, dan stemming. Ekstraksi fitur dilakukan menggunakan metode Term Frequency–Inverse Document Frequency (TF-IDF), sedangkan ketidakseimbangan kelas ditangani menggunakan Synthetic Minority Over-sampling Technique (SMOTE) pada tiga kategori sentimen, yaitu positif, negatif, dan netral. Hasil penelitian menunjukkan bahwa SVM mencapai tingkat akurasi tertinggi sebesar 90,02%, sementara Random Forest memperoleh nilai F1-score terbaik sebesar 88,08% ketika tersedia data pelatihan yang memadai. Naive Bayes menunjukkan performa yang relatif stabil pada berbagai ukuran data pelatihan. Selain itu, analisis kata kunci berbasis TF-IDF mengungkapkan bahwa ulasan negatif terutama berkaitan dengan masalah pengiriman, kendala teknis aplikasi, dan isu harga. Temuan ini menunjukkan bahwa pendekatan machine learning efektif untuk klasifikasi sentimen serta memberikan wawasan yang bermanfaat dalam meningkatkan kualitas layanan aplikasi mobile.   Kata Kunci: analisis sentimen; pembelajaran mesin; SMOTE; TF-IDF; klasifikasi teks.  

STUDENT DEPRESSION SCREENING BASED ON THE OPTIMUM DATA BALANCING AND RANDOM FOREST

Adnan, M. Sayyidul, Budi Santoso, Irwan, Crysdian , Cahyo
Abstract: Abstract: Mental health issues, particularly depression among young adult university students, are often detected late due to stigma and reluctance to seek medical consultation. The objective of this study is to develop… an early screening model employing machine learning techniques, specifically the random forest algorithm, on a dataset of 268 students (aged 17-29 years; consisting of 98 males and 170 females) within a multicultural educational setting. The principal challenges associated with this dataset are class imbalance and the potential for data leakage from clinical scores. This study implements a rigorous feature selection approach that involves the elimination of depression score features and the utilization of the Synthetic Minority Over-sampling Technique (SMOTE) to balance the training data distribution. Furthermore, a Threshold Tuning strategy is employed to prioritize detection sensitivity (Recall). The findings indicate that reducing the decision threshold to an optimal value of 0.25 led to a substantial enhancement in the recall value, increasing it from 36% (baseline) to 77%. A feature importance analysis was conducted, the results of which indicated that Total Social Connectedness (ToSC) is the most dominant predictor. In summary, the present study corroborates the notion that optimizing sensitivity through threshold tuning is of paramount importance for medical screening. Furthermore, social isolation factors emerge as more significant indicators of depression risk than demographic attributes.             Keywords: data mining; depression; imbalanced data; random forest; smote; threshold tuning     Abstrak: Masalah kesehatan mental, khususnya depresi di kalangan mahasiswa dewasa muda, sering terdeteksi terlambat akibat stigma dan enggan mencari konsultasi medis. Tujuan studi ini adalah mengembangkan model skrining dini menggunakan teknik machine learning, khususnya algoritma random forest, pada dataset 268 mahasiswa (usia 17-29 tahun; terdiri dari 98 laki-laki dan 170 perempuan) dalam lingkungan pendidikan multikultural. Tantangan utama yang terkait dengan dataset ini adalah ketidakseimbangan kelas dan potensi kebocoran data dari skor klinis. Studi ini menerapkan pendekatan seleksi fitur yang ketat, yang melibatkan eliminasi fitur skor depresi dan penggunaan Teknik Over-sampling Minoritas Sintetis (SMOTE) untuk menyeimbangkan distribusi data pelatihan. Selain itu, strategi Penyesuaian Ambang Batas diterapkan untuk memprioritaskan sensitivitas deteksi (Recall). Hasil penelitian menunjukkan bahwa mengurangi ambang batas keputusan ke nilai optimal 0,25 menyebabkan peningkatan signifikan dalam nilai recall, dari 36% (dasar) menjadi 77%. Analisis pentingnya fitur dilakukan, hasilnya menunjukkan bahwa Total Social Connectedness (ToSC) adalah prediktor yang paling dominan. Secara ringkas, studi ini membenarkan bahwa mengoptimalkan sensitivitas melalui penyesuaian ambang batas sangat penting untuk skrining medis. Selain itu, faktor isolasi sosial muncul sebagai indikator risiko depresi yang lebih signifikan daripada atribut demografis.   Kata kunci: penambangan data; depresi; data tidak seimbang; hutan acak; smote; penyesuaian ambang batas

HYBRID MOBILENETV2-SVM FOR ROBUST INDONESIAN BATIK MOTIF IDENTIFICATION

Putri Utami, Irawati, Sani, Asrul
Abstract: Abstract: Automated batik motif classification is challenged by high inter-class similarity and texture complexity. This study proposes a hybrid model integrating MobileNetV2 as a feature extractor and Support Vector Machine… hine (SVM) as the classifier to optimize accuracy and efficiency. Utilizing a Kaggle dataset of 8,640 images across 20 batik categories, the data was partitioned into 420 training images per class (Dayak: 360) and 15 testing images per class. The results demonstrate superior performance with 96.00% accuracy, exceeding the 90% target. The system showed high computational efficiency with a total execution time of 359.92 seconds and feature extraction taking only 22.63 seconds. This hybrid approach provides an ideal performance balance for resource-constrained mobile applications.             Keywords: batik classification; MobileNetV2; support vector machine; hybrid model; computational efficiency     Abstrak: Klasifikasi motif batik secara otomatis menghadapi tantangan kemiripan visual antar-kelas yang tinggi. Penelitian ini bertujuan mengoptimalkan akurasi dan efisiensi pengenalan batik menggunakan model hibrida MobileNetV2 sebagai pengekstraksi fitur dan Support Vector Machine (SVM) sebagai klasifikator. Menggunakan dataset Kaggle berisi 8.640 citra dari 20 kategori batik, data dibagi menjadi 420 citra latih per kelas (kecuali Batik Dayak 360) dan 15 citra uji per kelas. Hasil eksperimen menunjukkan performa impresif dengan akurasi 96,00%, melampaui target awal 90%. Sistem ini sangat efisien dengan total waktu eksekusi 359,92 detik, di mana ekstraksi fitur hanya membutuhkan 22,63 detik. Kombinasi MobileNetV2 dan SVM memberikan keseimbangan performa ideal untuk implementasi pada perangkat bergerak dengan sumber daya terbatas.   Kata kunci: klasifikasi batik; MobileNetV2; Support Vector Machine; Hybrid Model; efisiensi komputasi

RANDOM FOREST BASED SYSTEM FOR PREDICTING AND RECOMMENDING INMATE REHABILITATION PROGRAMS

Syahrul Farhan, Nurul Rahmadani, Mardalius
Abstract: Abstract: Rehabilitation programs are essential in correctional systems to equip inmates with the skills and behavioral readiness required for social reintegration. However, rehabilitation program assignment in many correctional… ectional institutions remains dependent on manual and subjective assessments, which may result in inconsistent decisions. This study develops a Random Forest–based prediction system to support objective and data-driven rehabilitation program determination. A quantitative approach was applied using historical inmate data from January 2023 to January 2025, comprising 2,023 records. The research process included data preprocessing, an 80:20 training–testing split, model training, and performance evaluation using accuracy, precision, recall, and F1-score metrics. The results show that the model achieved an accuracy of 86.17% during training in Google Colab and 68.83% when deployed within the application system. This performance gap reflects real-world deployment and computational constraints rather than model failure. The proposed system provides consistent and objective rehabilitation program recommendations, thereby supporting more effective rehabilitation planning and decision-making in correctional institutions. Keywords: correctional institutions; inmate rehabilitation programs; machine learning; random Forest; prediction system   Abstrak: Program pembinaan narapidana memiliki peran penting dalam sistem pemasyarakatan untuk membekali warga binaan dengan keterampilan serta kesiapan perilaku dalam proses reintegrasi ke masyarakat. Namun, pada banyak lembaga pemasyarakatan, penentuan program pembinaan masih bergantung pada penilaian manual yang bersifat subjektif, sehingga berpotensi menimbulkan ketidakkonsistenan dalam pengambilan keputusan. Penelitian ini mengembangkan sistem prediksi program pembinaan narapidana berbasis algoritma Random Forest guna mendukung pengambilan keputusan yang objektif dan berbasis data. Pendekatan kuantitatif diterapkan menggunakan data historis narapidana periode Januari 2023 hingga Januari 2025 sebanyak 2.023 data. Tahapan penelitian meliputi prapemrosesan data, pembagian data latih dan uji dengan rasio 80:20, pelatihan model, serta evaluasi performa menggunakan metrik akurasi, precision, recall, dan F1-score. Hasil penelitian menunjukkan bahwa model mencapai akurasi sebesar 86,17% pada tahap pelatihan di Google Colab dan 68,83% saat diimplementasikan pada sistem aplikasi. Perbedaan performa tersebut mencerminkan keterbatasan lingkungan operasional, bukan kegagalan model. Secara keseluruhan, sistem yang dikembangkan mampu memberikan rekomendasi program pembinaan yang lebih objektif dan konsisten, sehingga mendukung perencanaan pembinaan yang lebih efektif. Kata kunci: mesin pembelajaran; program pembinaan narapidana; random Forest; sistem pemasyarakatan; sistem prediksi

SENTIMENT ANALYSIS OF CUSTOMER REVIEWS ON E-COMMERCE APPLICATIONS: LAZADA, TOKOPEDIA, AND BLIBLI

Ihza, Andika, Arifin, Muhammad, Setiawan, Arif
Abstract: Abstract: The rapid growth of e-commerce in Indonesia has increased consumer interactions with digital platforms, particularly Lazada, Tokopedia, and Blibli, resulting in a large volume of customer reviews that reflect consumer… onsumer experiences and perceptions but have not been optimally utilized in business decision-making. The main issue addressed in this study is how to process customer review data to generate meaningful information regarding consumer opinions. This research aims to apply web scraping techniques to collect customer review data and conduct sentiment analysis to identify trends in consumer opinions across the three e-commerce platforms. The dataset consists of 3,000 customer reviews, with 1,000 reviews collected from each platform, covering aspects such as shopping experience, service quality, delivery process, and customer satisfaction. The research methodology includes data collection through web scraping, text preprocessing for data cleaning and normalization, sentiment analysis using machine learning approaches, and visualization of sentiment results. The findings indicate differences in the distribution of positive, negative, and neutral sentiments across platforms, reflecting variations in consumer experiences and service strategies. These results demonstrate that sentiment analysis based on customer reviews can serve as strategic input to improve service quality, business performance, and marketing strategies in Indonesia’s e-commerce sector.   Keywords: customer reviews; digital services; e-commerce; sentiment analysis; web scarping Abstrak: Pertumbuhan pesat e-commerce di Indonesia meningkatkan interaksi konsumen dengan platform digital, khususnya Lazada, Tokopedia, dan Blibli, yang menghasilkan ulasan pelanggan dalam jumlah besar sebagai cerminan pengalaman dan persepsi konsumen, namun belum dimanfaatkan secara optimal dalam pengambilan keputusan bisnis. Permasalahan utama penelitian ini adalah bagaimana mengolah data ulasan tersebut agar dapat memberikan informasi yang bermakna mengenai opini konsumen. Penelitian ini bertujuan menerapkan web scraping untuk mengumpulkan data ulasan pelanggan serta melakukan analisis sentimen guna mengidentifikasi tren opini konsumen pada ketiga platform e-commerce tersebut. Data yang digunakan berjumlah 3.000 ulasan pelanggan, dengan masing-masing platform diwakili oleh 1.000 ulasan yang mencakup pengalaman berbelanja, kualitas layanan, proses pengiriman, dan tingkat kepuasan pelanggan. Metode penelitian meliputi pengambilan data menggunakan web scraping, pra-pemrosesan teks untuk pembersihan dan normalisasi data, analisis sentimen dengan pendekatan pembelajaran mesin, serta visualisasi hasil sentimen. Hasil penelitian menunjukkan adanya perbedaan distribusi sentimen positif, negatif, dan netral pada setiap platform, yang mencerminkan variasi pengalaman konsumen dan strategi layanan. Temuan ini menunjukkan bahwa analisis sentimen berbasis ulasan pelanggan dapat menjadi masukan strategis untuk meningkatkan kualitas layanan, kinerja bisnis, dan strategi pemasaran e-commerce di Indonesia.   Kata kunci: customer reviews; digital services;e-commerce;sentiment analysis;web scarping

OPTIMIZING CYBER ATTACK SIMULATION AS A RESPONSE TO ESCALATING SECURITY THREATS USING A MACHINE LEARNING APPROACH

Lubis, Rivaldi, Halim, Apriyanto, Tanjaya, Felix Jansen, Tandri
Abstract: Abstract: The growing intensity of cyber attacks, marked by rapid, large-scale, automated, and adaptive execution, requires analytical methods that represent the diversity of network environments, including variations in… target platforms such as IoT, traditional networks, and hybrid infrastructures. This study compares machine learning models for cyber attack classification under heterogeneous environmental conditions and formulates a conceptual optimization framework based on model performance. Four publicly available benchmark datasets were used, namely UNB CIC IoT 2023, UNB CIC IDS-2018, UNSW-NB15, and a Kaggle cyber security attacks dataset, comprising approximately 40,000 to over 3.6 million records and 25 to 80 features across IoT, conventional, and mixed network environments. Random Forest, XGBoost, Multilayer Perceptron, and Transformer were implemented within a unified pipeline involving preprocessing, feature selection, and Bayesian Optimization-based hyperparameter tuning. All models achieved F1-score and Cohen's Kappa above 96%, with XGBoost performing best (97.80%, 97.26%), followed by Random Forest (97.78%, 96.96%) and Transformer (97.44%, 96.82%), while MLP scored lowest (96.74%, 96.00%), a gap below one percentage point. Confusion matrix analysis revealed persistent misclassification in minority and overlapping attack classes, informing a proposed adaptive cyber attack simulation optimization framework.             Keywords: cyber attacks; optimization; machine learning; environmental variability.     Abstrak: Meningkatnya intensitas serangan siber yang berlangsung cepat, masif, otomatis, dan adaptif menuntut pendekatan analitis yang merepresentasikan keragaman lingkungan jaringan, termasuk perbedaan karakteristik platform sasaran seperti Internet of Things (IoT), jaringan konvensional, dan infrastruktur hibrida. Penelitian ini membandingkan model machine learning untuk klasifikasi serangan siber pada kondisi lingkungan heterogen, sekaligus menyusun kerangka optimasi konseptual berdasarkan performa model. Empat dataset benchmark publik digunakan, yaitu UNB CIC IoT 2023, UNB CIC IDS-2018, UNSW-NB15, serta dataset Kaggle cyber security attacks, dengan jumlah data berkisar 40.000 hingga lebih dari 3,6 juta rekaman dan 25 sampai 80 fitur, mewakili lingkungan IoT, konvensional, dan campuran. Random Forest, XGBoost, Multilayer Perceptron, dan Transformer diimplementasikan melalui pipeline terpadu mencakup pra-pemrosesan, seleksi fitur, dan optimasi hyperparameter berbasis Bayesian Optimization. Seluruh model mencapai F1-score dan Cohen's Kappa di atas 96%, dengan XGBoost menunjukkan performa terbaik (97,80%, 97,26%), diikuti Random Forest (97,78%, 96,96%) dan Transformer (97,44%, 96,82%), sementara MLP mencatat skor terendah (96,74%, 96,00%), dengan selisih kurang dari satu poin persentase. Analisis confusion matrix mengungkap misklasifikasi yang konsisten pada kelas minoritas dan serangan dengan karakteristik serupa, yang menjadi dasar kerangka optimasi simulasi serangan siber adaptif yang diusulkan.   Kata kunci: serangan siber; optimasi; machine learning; variabilitas lingkungan

COMPARATIVE ANALYSIS OF RANDOM FOREST, KNN, AND SVM FOR TODDLER STUNTING CLASSIFICATION

Shula, Maritza Ayu, Sri Siswanti
Abstract: Abstract: Stunting is a chronic nutritional condition in toddlers characterized by a Height-for-Age (HFA) measurement below the standard growth threshold, necessitating early detection to prevent long-term consequences.… This study aims to classify toddler stunting status by comparing three machine learning methods: Random Forest (RF), K-Nearest Neighbor (KNN), and Support Vector Machine (SVM). The dataset comprises 345 toddler records from Puskesmas Indramayu (2025), including weight, height, and nutritional status based on WFA, HFA, and WFH indicators. Preprocessing steps include data cleaning, StandardScaler normalization, One-Hot Encoding for categorical features, and splitting the training and testing data with a ratio of 80:20. The comparison results are that KNN achieved the best performance with an accuracy of 71.01%, a precision of 0.69, a recall of 0.69, and an F1 score of 0.67, while RF and SVM both had an accuracy of 69.57% with F1 scores of 0.67 and 0.68, respectively. Thus, KNN demonstrated superior effectiveness in classifying the stunting status of toddlers compared to RF and SVM on this dataset.             Keywords: KNN; Random Forest; SVM; Stunting; toddlers     Abstract: Stunting adalah kondisi gizi kronis pada balita yang ditandai dengan pengukuran Tinggi Badan menurut Usia (HFA) di bawah ambang batas pertumbuhan standar, sehingga memerlukan deteksi dini untuk mencegah konsekuensi jangka panjang. Penelitian ini bertujuan untuk mengklasfikasikan status stunting pada balita dengan membandingkan tiga metode pembelajaran mesin: Random Forest (RF), K-Nearest Neighbor (KNN), dan Support Vector Machine (SVM). Kumpulan data terdiri dari 345 catatan balita dari puskesmas indramayu (2025), termaksut brat badan, tinggi badan, dan status gizi berdasarkan indicator WFA, HFA, dan WFH. Langkah-langkah prapemrosesan meliputi pembersian data, normalisasi Stand-ardScaler, One-Hot Encoding untuk fitur kategirikal, serta pembagian data pelatihan dan pengujian dengan rasio 80:20. Hasil perbadingan adalah KNN mencapai kinerja terbaik dengan akurasi 71,01%, presisi 0,69, recall 0,69, dan skor F1 sebesar 0,67,  RF dan SVM  keduanya memiliki akurasi 69,57% dengan skor F1 masing-masing sebesar 0,67 dan 0,68. Dengan demikian, KNN menunjukkan keefektifan yang lebih unggul dalam mengklasifikasikan status stunting balita dibandingkan dengan RF dan SVM pada da-taset ini.   Kata kunci: KNN; random forest; SVM; Stunting; Balita