Abstract:Penggunaan dompet digital yang terus meningkat menghasilkan banyak ulasan pengguna yang dapat dimanfaatkan untuk mengevaluasi kualitas layanan. Penelitian ini bertujuan meningkatkan akurasi klasifikasi sentimen pengguna…
dompet digital menggunakan metode Stacking Ensemble Machine Learning yang mengombinasikan Support Vector Machine (SVM), Multinomial Naïve Bayes (MNB), dan AdaBoost dengan Logistic Regression sebagai meta-learner. Data ulasan diproses melalui tahapan text preprocessing meliputi case folding, cleaning, tokenizing, stopword removal, stemming, dan pembobotan fitur menggunakan TF-IDF. Penyeimbangan data dilakukan dengan SMOTE, sedangkan evaluasi model menggunakan 5-Fold Cross-Validation. Hasil penelitian menunjukkan bahwa model Stacking Ensemble memperoleh akurasi rata-rata 80,55%, lebih tinggi dibandingkan algoritma dasar. Evaluasi menggunakan Confusion Matrix, Classification Report, dan ROC Curve juga menunjukkan peningkatan nilai precision, recall, F1-score, dan kemampuan diskriminasi model. Hasil ini menunjukkan bahwa pendekatan Stacking Ensemble Machine Learning efektif untuk meningkatkan akurasi klasifikasi sentimen pengguna dompet digital serta mendukung evaluasi kualitas layanan berbasis opini pengguna.
The rapid growth of digital wallet usage has generated a large volume of user reviews that can be utilized to evaluate service quality. This study aims to improve the accuracy of digital wallet user sentiment classification using a Stacking Ensemble Machine Learning approach that combines Support Vector Machine (SVM), Multinomial Naïve Bayes (MNB), and AdaBoost with Logistic Regression as the meta-learner. User reviews were processed through text preprocessing stages, including case folding, text cleaning, tokenization, stopword removal, stemming, and TF-IDF feature weighting. Synthetic Minority Over-sampling Technique (SMOTE) was employed to address class imbalance, while model performance was evaluated using 5-Fold Cross-Validation. The experimental results show that the proposed Stacking Ensemble model achieved an average accuracy of 80.55%, outperforming the individual base learners. Furthermore, evaluations based on the Confusion Matrix, Classification Report, and Receiver Operating Characteristic (ROC) Curve demonstrated improvements in precision, recall, F1-score, and the model's discriminative capability. These findings indicate that the proposed Stacking Ensemble Machine Learning approach is effective in improving the accuracy of digital wallet user sentiment classification and can serve as a reliable tool for supporting service quality evaluation based on user opinions.
Abstract:This anthropological study examines the experiences of the Muslim minority in Rantepao City, North Toraja Regency, focusing on religious freedom and interfaith dynamics. In a predominantly Christian region, the Muslim community…
mmunity navigates its religious identity within a deeply rooted Torajan cultural landscape. Through ethnographic methods, including participant observation and in-depth interviews, this research explores how minority Muslims practice their faith, access public space, and maintain communal harmony. The findings reveal that religious freedom in Rantepao is negotiated through a balance of cultural assimilation and religious preservation. While formal rights are generally respected, subtle social boundaries exist, particularly regarding religious expression and ritual intersections with traditional Torajan customs (Aluk To Dolo). This study highlights the resilience of the Muslim minority and demonstrates how local cultural mechanisms facilitate daily coexistence, offering crucial insights into religious tolerance and minority-majority relations in contemporary Indonesia.
Abstract:Abstract: This study aims to classify the nutritional status of toddlers based on anthropometric data using the K-Nearest Neighbor (KNN) algorithm. Data were obtained from 20 Integrated Health Posts (Posyandu) in Rumbai…
Timur District, including Lembah Sari Village and Limbungan Village with a total of 1,000 toddler data. After cleaning and preprocessing, 782 data were obtained ready for use. The preprocessing stages include data cleaning and transformation, outlier removal, minority class handling, and data normalization. Next, data balancing was carried out using the Synthetic Minority Oversampling Technique (SMOTE) to address class imbalance. The data was divided into 80% training data and 20% test data, then the K parameter was tested from 1 to 15 using 5-fold cross-validation. The results showed that the value of K = 1 provided the best performance with a macro recall of 0.8827 and an accuracy of 86.26%. These results indicate that the combination of the KNN algorithm with the SMOTE method and Min-Max normalization is effective in improving classification performance on imbalanced data and producing accurate and balanced predictions of toddler nutritional status between classes.
Keywords: k-nearest neighbor; toddler nutritional status; SMOTE; min-max scaling; classification; anthropometric data
Abstrak: Penelitian ini bertujuan untuk mengklasifikasikan status gizi balita berdasarkan data antropometri menggunakan algoritma K-Nearest Neighbor (KNN). Data diperoleh dari 20 Posyandu di Kecamatan Rumbai Timur, meliputi Kelurahan Lembah Sari dan Kelurahan Limbungan dengan total 1.000 data balita. Setelah melalui proses cleaning dan preprocessing, diperoleh 782 data yang siap digunakan. Tahapan pra-pemrosesan meliputi pembersihan dan transformasi data, penghapusan outlier, penanganan kelas minoritas, serta normalisasi data. Selanjutnya dilakukan penyeimbangan data menggunakan Synthetic Minority Oversampling Technique (SMOTE) untuk mengatasi ketidakseimbangan kelas. Data dibagi menjadi 80% data latih dan 20% data uji, kemudian dilakukan pengujian parameter K dari 1 hingga 15 menggunakan 5-fold cross-validation. Hasil penelitian menunjukkan bahwa nilai K = 1 memberikan performa terbaik dengan recall macro sebesar 0,8827 dan akurasi 86,26%. Hasil ini menunjukkan bahwa kombinasi algoritma KNN dengan metode SMOTE dan normalisasi Min-Max efektif dalam meningkatkan kinerja klasifikasi pada data tidak seimbang serta menghasilkan prediksi status gizi balita yang akurat dan seimbang antar kelas.
Kata kunci: k-nearest neighbor; status gizi balita; SMOTE; min-max scaling; klasifikasi; data antropometri
Abstract:Abstract: The rapid growth of e-commerce mobile applications has generated large volumes of user reviews, making manual sentiment analysis increasingly impractical. This study aims to compare the effectiveness of three machine…
achine learning algorithms Support Vector Machine (SVM), Random Forest, and Naive Bayes for automated sentiment classification of Indonesian-language mobile application reviews. A dataset of 3,000 user reviews from the RupaRupa application on the Google Play Store was collected and preprocessed through normalization, tokenization, stopword removal, and stemming. TF-IDF vectorization was applied for feature extraction, while the Synthetic Minority Over-sampling Technique (SMOTE) was used to address class imbalance across three sentiment categories: positive, negative, and neutral. The results show that SVM achieved the highest accuracy of 90.02%, while Random Forest obtained the best F1-score of 88.08% when sufficient training data were available. Naive Bayes demonstrated relatively stable performance across varying training data sizes. Furthermore, TF-IDF keyword analysis revealed that negative reviews were primarily associated with delivery issues, technical problems, and pricing concerns. These findings demonstrate the effectiveness of machine learning approaches for sentiment classification and provide practical insights for improving mobile application services.
Keywords: sentiment analysis; machine learning; SMOTE; TF-IDF; text classification
Abstrak: Pertumbuhan pesat aplikasi mobile e-commerce telah menghasilkan volume ulasan pengguna yang sangat besar, sehingga analisis sentimen secara manual menjadi semakin tidak praktis. Penelitian ini bertujuan untuk membandingkan efektivitas tiga algoritma machine learning Support Vector Machine (SVM), Random Forest, dan Naive Bayes dalam melakukan klasifikasi sentimen otomatis terhadap ulasan aplikasi mobile berbahasa Indonesia. Dataset yang digunakan terdiri dari 3.000 ulasan pengguna aplikasi RupaRupa yang dikumpulkan dari Google Play Store. Data kemudian diproses melalui tahapan preprocessing yang meliputi normalisasi, tokenisasi, penghapusan stopword, dan stemming. Ekstraksi fitur dilakukan menggunakan metode Term Frequency–Inverse Document Frequency (TF-IDF), sedangkan ketidakseimbangan kelas ditangani menggunakan Synthetic Minority Over-sampling Technique (SMOTE) pada tiga kategori sentimen, yaitu positif, negatif, dan netral. Hasil penelitian menunjukkan bahwa SVM mencapai tingkat akurasi tertinggi sebesar 90,02%, sementara Random Forest memperoleh nilai F1-score terbaik sebesar 88,08% ketika tersedia data pelatihan yang memadai. Naive Bayes menunjukkan performa yang relatif stabil pada berbagai ukuran data pelatihan. Selain itu, analisis kata kunci berbasis TF-IDF mengungkapkan bahwa ulasan negatif terutama berkaitan dengan masalah pengiriman, kendala teknis aplikasi, dan isu harga. Temuan ini menunjukkan bahwa pendekatan machine learning efektif untuk klasifikasi sentimen serta memberikan wawasan yang bermanfaat dalam meningkatkan kualitas layanan aplikasi mobile.
Kata Kunci: analisis sentimen; pembelajaran mesin; SMOTE; TF-IDF; klasifikasi teks.
Abstract:Abstract: Mental health issues, particularly depression among young adult university students, are often detected late due to stigma and reluctance to seek medical consultation. The objective of this study is to develop…
an early screening model employing machine learning techniques, specifically the random forest algorithm, on a dataset of 268 students (aged 17-29 years; consisting of 98 males and 170 females) within a multicultural educational setting. The principal challenges associated with this dataset are class imbalance and the potential for data leakage from clinical scores. This study implements a rigorous feature selection approach that involves the elimination of depression score features and the utilization of the Synthetic Minority Over-sampling Technique (SMOTE) to balance the training data distribution. Furthermore, a Threshold Tuning strategy is employed to prioritize detection sensitivity (Recall). The findings indicate that reducing the decision threshold to an optimal value of 0.25 led to a substantial enhancement in the recall value, increasing it from 36% (baseline) to 77%. A feature importance analysis was conducted, the results of which indicated that Total Social Connectedness (ToSC) is the most dominant predictor. In summary, the present study corroborates the notion that optimizing sensitivity through threshold tuning is of paramount importance for medical screening. Furthermore, social isolation factors emerge as more significant indicators of depression risk than demographic attributes.
Keywords: data mining; depression; imbalanced data; random forest; smote; threshold tuning
Abstrak: Masalah kesehatan mental, khususnya depresi di kalangan mahasiswa dewasa muda, sering terdeteksi terlambat akibat stigma dan enggan mencari konsultasi medis. Tujuan studi ini adalah mengembangkan model skrining dini menggunakan teknik machine learning, khususnya algoritma random forest, pada dataset 268 mahasiswa (usia 17-29 tahun; terdiri dari 98 laki-laki dan 170 perempuan) dalam lingkungan pendidikan multikultural. Tantangan utama yang terkait dengan dataset ini adalah ketidakseimbangan kelas dan potensi kebocoran data dari skor klinis. Studi ini menerapkan pendekatan seleksi fitur yang ketat, yang melibatkan eliminasi fitur skor depresi dan penggunaan Teknik Over-sampling Minoritas Sintetis (SMOTE) untuk menyeimbangkan distribusi data pelatihan. Selain itu, strategi Penyesuaian Ambang Batas diterapkan untuk memprioritaskan sensitivitas deteksi (Recall). Hasil penelitian menunjukkan bahwa mengurangi ambang batas keputusan ke nilai optimal 0,25 menyebabkan peningkatan signifikan dalam nilai recall, dari 36% (dasar) menjadi 77%. Analisis pentingnya fitur dilakukan, hasilnya menunjukkan bahwa Total Social Connectedness (ToSC) adalah prediktor yang paling dominan. Secara ringkas, studi ini membenarkan bahwa mengoptimalkan sensitivitas melalui penyesuaian ambang batas sangat penting untuk skrining medis. Selain itu, faktor isolasi sosial muncul sebagai indikator risiko depresi yang lebih signifikan daripada atribut demografis.
Kata kunci: penambangan data; depresi; data tidak seimbang; hutan acak; smote; penyesuaian ambang batas
Abstract:Abstract: The growing intensity of cyber attacks, marked by rapid, large-scale, automated, and adaptive execution, requires analytical methods that represent the diversity of network environments, including variations in…
target platforms such as IoT, traditional networks, and hybrid infrastructures. This study compares machine learning models for cyber attack classification under heterogeneous environmental conditions and formulates a conceptual optimization framework based on model performance. Four publicly available benchmark datasets were used, namely UNB CIC IoT 2023, UNB CIC IDS-2018, UNSW-NB15, and a Kaggle cyber security attacks dataset, comprising approximately 40,000 to over 3.6 million records and 25 to 80 features across IoT, conventional, and mixed network environments. Random Forest, XGBoost, Multilayer Perceptron, and Transformer were implemented within a unified pipeline involving preprocessing, feature selection, and Bayesian Optimization-based hyperparameter tuning. All models achieved F1-score and Cohen's Kappa above 96%, with XGBoost performing best (97.80%, 97.26%), followed by Random Forest (97.78%, 96.96%) and Transformer (97.44%, 96.82%), while MLP scored lowest (96.74%, 96.00%), a gap below one percentage point. Confusion matrix analysis revealed persistent misclassification in minority and overlapping attack classes, informing a proposed adaptive cyber attack simulation optimization framework.
Keywords: cyber attacks; optimization; machine learning; environmental variability.
Abstrak: Meningkatnya intensitas serangan siber yang berlangsung cepat, masif, otomatis, dan adaptif menuntut pendekatan analitis yang merepresentasikan keragaman lingkungan jaringan, termasuk perbedaan karakteristik platform sasaran seperti Internet of Things (IoT), jaringan konvensional, dan infrastruktur hibrida. Penelitian ini membandingkan model machine learning untuk klasifikasi serangan siber pada kondisi lingkungan heterogen, sekaligus menyusun kerangka optimasi konseptual berdasarkan performa model. Empat dataset benchmark publik digunakan, yaitu UNB CIC IoT 2023, UNB CIC IDS-2018, UNSW-NB15, serta dataset Kaggle cyber security attacks, dengan jumlah data berkisar 40.000 hingga lebih dari 3,6 juta rekaman dan 25 sampai 80 fitur, mewakili lingkungan IoT, konvensional, dan campuran. Random Forest, XGBoost, Multilayer Perceptron, dan Transformer diimplementasikan melalui pipeline terpadu mencakup pra-pemrosesan, seleksi fitur, dan optimasi hyperparameter berbasis Bayesian Optimization. Seluruh model mencapai F1-score dan Cohen's Kappa di atas 96%, dengan XGBoost menunjukkan performa terbaik (97,80%, 97,26%), diikuti Random Forest (97,78%, 96,96%) dan Transformer (97,44%, 96,82%), sementara MLP mencatat skor terendah (96,74%, 96,00%), dengan selisih kurang dari satu poin persentase. Analisis confusion matrix mengungkap misklasifikasi yang konsisten pada kelas minoritas dan serangan dengan karakteristik serupa, yang menjadi dasar kerangka optimasi simulasi serangan siber adaptif yang diusulkan.
Kata kunci: serangan siber; optimasi; machine learning; variabilitas lingkungan
Abstract:Abstract: The rapid growth of the cosmetics industry on e-commerce platforms has intensified competition, creating a critical need for effective, data-driven marketing strategies. This study aims to conduct a comparative…
analysis of machine learning algorithms to predict the sales categories (High, Medium, Low) of cosmetic products on the Tokopedia marketplace. Four classification models; Random Forest, XGBoost, Logistic Regression, and Naive Bayes were trained and evaluated on data collected via web scraping. The methodology incorporates the Synthetic Minority Over-sampling Technique (SMOTE) to address significant class imbalance and GridSearchCV for hyperparameter optimization to ensure a fair and robust comparison. The experimental results conclusively show that the Random Forest model achieved the best performance, yielding the highest F1-Score Macro Average of 0.75 and an accuracy of 85.3%. The superior model was subsequently implemented in a simple recommendation system to simulate optimal discount strategies, demonstrating its practical utility in providing actionable insights for business decisions.
Keywords: classification; comparative analysis; machine learning; sales prediction; SMOTE
Abstrak: Pertumbuhan pesat industri kosmetik pada platform e-commerce telah membuat persaingan ketat, sehingga menciptakan kebutuhan krusial akan strategi pemasaran yang efektif dan berbasis data. Penelitian ini bertujuan untuk melakukan analisis komparatif terhadap algoritma machine learning untuk memprediksi kategori penjualan (Tinggi, Sedang, Rendah) produk kosmetik di marketplace Tokopedia. Empat model klasifikasi, yaitu Random Forest, XGBoost, Regresi Logistik, dan Naive Bayes, dilatih dan dievaluasi menggunakan data yang dikumpulkan melalui web scraping. Metodologi penelitian ini menerapkan Synthetic Minority Over-sampling Technique (SMOTE) untuk mengatasi ketidakseimbangan kelas yang signifikan dan GridSearchCV untuk optimisasi hyperparameter guna memastikan perbandingan yang adil. Hasil eksperimen menunjukkan bahwa model Random Forest mencapai performa terbaik, dengan menghasilkan F1-Score Macro Average tertinggi sebesar 0,75 dan akurasi 85,3%. Model unggul ini kemudian diimplementasikan dalam sebuah sistem rekomendasi sederhana untuk menyimulasikan strategi diskon yang optimal, yang menunjukkan kegunaan praktisnya dalam memberikan wawasan yang dapat ditindaklanjuti untuk pengambilan keputusan bisnis.
Kata kunci: analisis komparatif; klasifikasi; machine learning; prediksi penjualan; SMOTE
Abstract:Abstract: This study applies an integrated approach to optimize heart failure classification. The main objective is to address the challenge of class imbalance in medical datasets and to improve the accuracy, sensitivity,…
, and generalization of the classification model. The urgency of this issue is emphasized by statistics showing that cardiovascular diseases cause approximately 17.9 million deaths worldwide each year. Using a quantitative experimental approach, this study analyzes the "Heart Failure Prediction Dataset" from Kaggle, which consists of 918 records. The data were processed through normalization and encoding, followed by the application of SMOTE on the training set to balance class distribution. This step successfully increased model accuracy from 88.41% to 90.22% and minority class recall from 0.82 to 0.88. Furthermore, Bayesian Optimization was employed to refine the hyperparameters of SVM, resulting in a final model with an accuracy of 89.13% that demonstrated better generalization. This integrated approach significantly enhances the stability, sensitivity, and generalization of the model, making it a reliable tool for clinical decision support systems in predicting heart failure.
Keywords: bayesian optimization; heart failure; machine learning; SMOTE; SVM.
Abstrak: Penelitian ini menerapkan pendekatan terintegrasi untuk mengoptimalkan klasifikasi gagal jantung. Tujuan utama studi ini adalah untuk mengatasi tantangan ketidakseimbangan kelas dalam dataset medis dan meningkatkan akurasi, sensitivitas, serta generalisasi model klasifikasi. Urgensi ini ditegaskan oleh statistik yang menunjukkan bahwa penyakit kardiovaskular menyebabkan sekitar 17,9 juta kematian setiap tahun secara global. Menggunakan pendekatan eksperimental kuantitatif, penelitian ini menganalisis "Heart Failure Prediction Dataset" dari Kaggle, yang terdiri dari 918 catatan. Data diproses dengan normalisasi dan encoding, lalu SMOTE diterapkan pada data pelatihan untuk menyeimbangkan distribusi kelas. Langkah ini berhasil meningkatkan akurasi dari 88,41% menjadi 90,22% dan recall kelas minoritas dari 0,82 menjadi 0,88. Selanjutnya, Bayesian Optimization menyempurnakan hyperparameter SVM, menghasilkan model akhir dengan akurasi 89,13% yang menunjukkan generalisasi lebih baik. Pendekatan terintegrasi ini secara signifikan meningkatkan stabilitas, sensitivitas, dan generalisasi model. Hasil penelitian ini menjadikannya alat yang andal untuk sistem pendukung keputusan klinis dalam prediksi gagal jantung.
Kata kunci: bayesian optimization; gagal jantung; machine learning; SMOTE; SVM