Abstract:Abstract: Existing IoT anomaly detection studies have achieved high classification performance, but most focus on accuracy and F1-score without explicitly controlling the false positive rate (FPR). In addition, many approaches…
oaches rely on a single detection perspective, limiting their operational reliability. To address this gap, this study proposes a hybrid anomaly detection framework integrating Long Short-Term Memory (LSTM), Shannon entropy, and autoencoder reconstruction error. Shannon entropy is incorporated as an additional feature, while LSTM and the autoencoder capture temporal and reconstruction characteristics. The resulting hybrid representation is processed by a constraint-based threshold selection mechanism that enforces FPR . Experiments on the TON-IoT and Edge-IIoTset datasets achieved average F1-scores of 0.9250 and 0.9934, while maintaining average FPR values of 0.0091 and 0.0714, respectively. Analysis of entropy distributions showed consistent differences between normal and anomalous traffic across both datasets, indicating that Shannon entropy provides discriminative information for anomaly detection. These results demonstrate strong detection performance with controlled false alarms, while ablation studies confirm the significant contribution of Shannon entropy to overall model performance.
Keywords: false positive rate; hybrid deep learning; Internet of Things; network anomaly detection; Shannon entropy
Abstrak: Penelitian deteksi anomali Internet of Things (IoT) telah menunjukkan performa klasifikasi yang tinggi, namun sebagian besar masih berfokus pada accuracy dan F1-score tanpa mengendalikan false positive rate (FPR) secara eksplisit. Selain itu, banyak pendekatan hanya memanfaatkan satu perspektif deteksi sehingga reliabilitas operasionalnya masih terbatas. Untuk mengatasi kesenjangan tersebut, penelitian ini mengusulkan kerangka deteksi anomali hybrid yang mengintegrasikan Long Short-Term Memory (LSTM), Shannon entropy, dan autoencoder reconstruction error. Shannon entropy digunakan sebagai fitur tambahan, sedangkan LSTM dan autoencoder menangkap karakteristik temporal dan deviasi rekonstruksi. Representasi hybrid yang dihasilkan kemudian diproses melalui mekanisme constraint-based threshold selection dengan batas FPR . Hasil pengujian pada dataset TON-IoT dan Edge-IIoTset menghasilkan F1-score rata-rata sebesar 0,9250 dan 0,9934, dengan FPR rata-rata sebesar 0,0091 dan 0,0714. Perbedaan nilai entropy yang konsisten antara trafik normal dan anomali pada kedua dataset menunjukkan bahwa Shannon entropy menyediakan informasi diskriminatif untuk deteksi anomali. Hasil tersebut menunjukkan performa deteksi yang kuat dengan false alarm yang terkendali, sementara studi ablasi mengonfirmasi kontribusi signifikan Shannon entropy terhadap performa model.
Kata kunci: deteksi anomali jaringan; false positive rate; hybrid deep learning; Internet of Things; Shannon entropy
Abstract:Abstract: Job training is one of the government’s efforts to improve the quality of human resources so that they possess competencies that meet labor market demands. The process of selecting training participants at the…
e Department of Manpower of Asahan Regency is still carried out manually, which can lead to subjectivity and inefficiency in determining the most eligible candidates. This study aims to develop a decision support system using the Technique for Order Preference by Similarity to Ideal Solution (TOPSIS) method to assist the selection process objectively and systematically. The study applies four evaluation criteria, namely education level, age, work experience, and interview, with a dataset consisting of 31 training candidates. The system is developed as a web-based application using PHP programming language and MySQL database. The TOPSIS method is applied through decision matrix normalization, weighting, determination of positive and negative ideal solutions, and preference value calculation to produce a ranking of candidates. The results show that the proposed system can provide objective recommendations for selecting training participants, improve the efficiency of the selection process, and support decision makers in producing more accurate and reliable decisions.
Keywords: decision support system; selection; training; TOPSIS.
Abstrak: Pelatihan tenaga kerja merupakan salah satu upaya pemerintah dalam meningkatkan kualitas sumber daya manusia agar memiliki kompetensi yang sesuai dengan kebutuhan dunia kerja. Proses pemilihan calon peserta pelatihan di Dinas Tenaga Kerja Kabupaten Asahan selama ini masih dilakukan secara manual sehingga berpotensi menimbulkan subjektivitas dan kurang efektif dalam menentukan peserta yang paling layak. Penelitian ini bertujuan untuk membangun sistem pendukung keputusan menggunakan metode Technique for Order Preference by Similarity to Ideal Solution (TOPSIS) untuk membantu proses seleksi peserta pelatihan secara objektif dan sistematis. Penelitian ini menggunakan empat kriteria penilaian yaitu pendidikan, usia, pengalaman kerja, dan wawancara dengan jumlah data sebanyak 31 calon peserta pelatihan. Sistem dikembangkan berbasis web menggunakan bahasa pemrograman PHP dan database MySQL. Metode TOPSIS digunakan untuk melakukan normalisasi matriks keputusan, pembobotan, penentuan solusi ideal positif dan negatif, serta perhitungan nilai preferensi untuk menghasilkan perankingan peserta pelatihan. Hasil penelitian menunjukkan bahwa sistem yang dibangun mampu memberikan rekomendasi peserta pelatihan secara objektif, meningkatkan efisiensi proses seleksi, serta membantu pihak dinas dalam pengambilan keputusan yang lebih akurat.
Kata kunci: pelatihan; seleksi; sistem pendukung keputusan; TOPSIS.
Abstract:Abstract: The rapid growth of e-commerce mobile applications has generated large volumes of user reviews, making manual sentiment analysis increasingly impractical. This study aims to compare the effectiveness of three machine…
achine learning algorithms Support Vector Machine (SVM), Random Forest, and Naive Bayes for automated sentiment classification of Indonesian-language mobile application reviews. A dataset of 3,000 user reviews from the RupaRupa application on the Google Play Store was collected and preprocessed through normalization, tokenization, stopword removal, and stemming. TF-IDF vectorization was applied for feature extraction, while the Synthetic Minority Over-sampling Technique (SMOTE) was used to address class imbalance across three sentiment categories: positive, negative, and neutral. The results show that SVM achieved the highest accuracy of 90.02%, while Random Forest obtained the best F1-score of 88.08% when sufficient training data were available. Naive Bayes demonstrated relatively stable performance across varying training data sizes. Furthermore, TF-IDF keyword analysis revealed that negative reviews were primarily associated with delivery issues, technical problems, and pricing concerns. These findings demonstrate the effectiveness of machine learning approaches for sentiment classification and provide practical insights for improving mobile application services.
Keywords: sentiment analysis; machine learning; SMOTE; TF-IDF; text classification
Abstrak: Pertumbuhan pesat aplikasi mobile e-commerce telah menghasilkan volume ulasan pengguna yang sangat besar, sehingga analisis sentimen secara manual menjadi semakin tidak praktis. Penelitian ini bertujuan untuk membandingkan efektivitas tiga algoritma machine learning Support Vector Machine (SVM), Random Forest, dan Naive Bayes dalam melakukan klasifikasi sentimen otomatis terhadap ulasan aplikasi mobile berbahasa Indonesia. Dataset yang digunakan terdiri dari 3.000 ulasan pengguna aplikasi RupaRupa yang dikumpulkan dari Google Play Store. Data kemudian diproses melalui tahapan preprocessing yang meliputi normalisasi, tokenisasi, penghapusan stopword, dan stemming. Ekstraksi fitur dilakukan menggunakan metode Term Frequency–Inverse Document Frequency (TF-IDF), sedangkan ketidakseimbangan kelas ditangani menggunakan Synthetic Minority Over-sampling Technique (SMOTE) pada tiga kategori sentimen, yaitu positif, negatif, dan netral. Hasil penelitian menunjukkan bahwa SVM mencapai tingkat akurasi tertinggi sebesar 90,02%, sementara Random Forest memperoleh nilai F1-score terbaik sebesar 88,08% ketika tersedia data pelatihan yang memadai. Naive Bayes menunjukkan performa yang relatif stabil pada berbagai ukuran data pelatihan. Selain itu, analisis kata kunci berbasis TF-IDF mengungkapkan bahwa ulasan negatif terutama berkaitan dengan masalah pengiriman, kendala teknis aplikasi, dan isu harga. Temuan ini menunjukkan bahwa pendekatan machine learning efektif untuk klasifikasi sentimen serta memberikan wawasan yang bermanfaat dalam meningkatkan kualitas layanan aplikasi mobile.
Kata Kunci: analisis sentimen; pembelajaran mesin; SMOTE; TF-IDF; klasifikasi teks.
Abstract:Abstract: The election of the Student Council President is an important process in building a democratic, responsible, and integrity-based leadership culture in the school environment. In addition, through the main discussion…
ssion in this study aims to optimize the selection process for candidates for Student Council President at SMP Negeri 11 Tanjung Balai through the implementation of a Decision Support System (DSS) based on the MOORA (Multi-Objective Optimization on the Basis of Ratio Analysis) method. The MOORA method is used to normalize values, weight criteria, and calculate optimization values to produce the best alternative ranking. Data were obtained through observation, interviews with school officials, and literature studies. The results of the study indicate that the MOORA method is able to provide objective and transparent ranking results, where M. Asril Sitorus Pane obtained the highest score of 0.347 (Rank 1), followed by M. Rian with a score of 0.333 (Rank 2). The implementation of this system is expected to be able to provide recommendations for the best candidates regularly and accurately, so that it can support fairer and more accountable decision-making in the next Student Council President election.
Keywords: decision support system; osis chairman election; MOORA; SMP negeri 11 tanjung balai.
Abstrak: Pemilihan Ketua OSIS merupakan proses penting dalam membangun budaya kepemimpinan yang demokratis, bertanggung jawab dan berintegritas di lingkungan sekolah. Selain itu, melalui pokok pembahasan pada penelitian ini bertujuan untuk dapat mengoptimalkan proses seleksi calon Ketua OSIS di SMP Negeri 11 Tanjung Balai melalui penerapan Sistem Pendukung Keputusan berbasis metode MOORA (Multi-Objective Optimization on the Basis of Ratio Analysis). Metode MOORA digunakan agar dapat melakukan normalisasi nilai, pembobotan kriteria serta perhitungan nilai optimasi guna menghasilkan peringkat alternatif terbaik. Data diperoleh melalui observasi, wawancara dengan pihak sekolah serta dan studi kepustakaan. Hasil penelitian menunjukkan bahwa metode MOORA mampu memberikan hasil peringkat yang objektif dan transparan, yang dimana M. Asril Sitorus Pane memperoleh nilai tertinggi sebesar 0,347 (Peringkat 1), diikuti oleh M. Rian dengan nilai 0,333 (Peringkat 2). Penerapan sistem ini diharapkan mampu memberikan rekomendasi kandidat terbaik secara sistematis dan akurat, sehingga dapat mendukung pengambilan keputusan yang lebih adil dan akuntabel dalam pemilihan Ketua OSIS selanjutnya.
Kata kunci: MOORA; pemilihan ketua osis; sistem pendukung keputusan; SMP negeri 11 tanjung balai.
Abstract:Abstract: The rapid growth of e-commerce in Indonesia has increased consumer interactions with digital platforms, particularly Lazada, Tokopedia, and Blibli, resulting in a large volume of customer reviews that reflect consumer…
onsumer experiences and perceptions but have not been optimally utilized in business decision-making. The main issue addressed in this study is how to process customer review data to generate meaningful information regarding consumer opinions. This research aims to apply web scraping techniques to collect customer review data and conduct sentiment analysis to identify trends in consumer opinions across the three e-commerce platforms. The dataset consists of 3,000 customer reviews, with 1,000 reviews collected from each platform, covering aspects such as shopping experience, service quality, delivery process, and customer satisfaction. The research methodology includes data collection through web scraping, text preprocessing for data cleaning and normalization, sentiment analysis using machine learning approaches, and visualization of sentiment results. The findings indicate differences in the distribution of positive, negative, and neutral sentiments across platforms, reflecting variations in consumer experiences and service strategies. These results demonstrate that sentiment analysis based on customer reviews can serve as strategic input to improve service quality, business performance, and marketing strategies in Indonesia’s e-commerce sector.
Keywords: customer reviews; digital services; e-commerce; sentiment analysis; web scarping
Abstrak: Pertumbuhan pesat e-commerce di Indonesia meningkatkan interaksi konsumen dengan platform digital, khususnya Lazada, Tokopedia, dan Blibli, yang menghasilkan ulasan pelanggan dalam jumlah besar sebagai cerminan pengalaman dan persepsi konsumen, namun belum dimanfaatkan secara optimal dalam pengambilan keputusan bisnis. Permasalahan utama penelitian ini adalah bagaimana mengolah data ulasan tersebut agar dapat memberikan informasi yang bermakna mengenai opini konsumen. Penelitian ini bertujuan menerapkan web scraping untuk mengumpulkan data ulasan pelanggan serta melakukan analisis sentimen guna mengidentifikasi tren opini konsumen pada ketiga platform e-commerce tersebut. Data yang digunakan berjumlah 3.000 ulasan pelanggan, dengan masing-masing platform diwakili oleh 1.000 ulasan yang mencakup pengalaman berbelanja, kualitas layanan, proses pengiriman, dan tingkat kepuasan pelanggan. Metode penelitian meliputi pengambilan data menggunakan web scraping, pra-pemrosesan teks untuk pembersihan dan normalisasi data, analisis sentimen dengan pendekatan pembelajaran mesin, serta visualisasi hasil sentimen. Hasil penelitian menunjukkan adanya perbedaan distribusi sentimen positif, negatif, dan netral pada setiap platform, yang mencerminkan variasi pengalaman konsumen dan strategi layanan. Temuan ini menunjukkan bahwa analisis sentimen berbasis ulasan pelanggan dapat menjadi masukan strategis untuk meningkatkan kualitas layanan, kinerja bisnis, dan strategi pemasaran e-commerce di Indonesia.
Kata kunci: customer reviews; digital services;e-commerce;sentiment analysis;web scarping
Abstract:Abstract: Stunting is a chronic nutritional condition in toddlers characterized by a Height-for-Age (HFA) measurement below the standard growth threshold, necessitating early detection to prevent long-term consequences.…
This study aims to classify toddler stunting status by comparing three machine learning methods: Random Forest (RF), K-Nearest Neighbor (KNN), and Support Vector Machine (SVM). The dataset comprises 345 toddler records from Puskesmas Indramayu (2025), including weight, height, and nutritional status based on WFA, HFA, and WFH indicators. Preprocessing steps include data cleaning, StandardScaler normalization, One-Hot Encoding for categorical features, and splitting the training and testing data with a ratio of 80:20. The comparison results are that KNN achieved the best performance with an accuracy of 71.01%, a precision of 0.69, a recall of 0.69, and an F1 score of 0.67, while RF and SVM both had an accuracy of 69.57% with F1 scores of 0.67 and 0.68, respectively. Thus, KNN demonstrated superior effectiveness in classifying the stunting status of toddlers compared to RF and SVM on this dataset.
Keywords: KNN; Random Forest; SVM; Stunting; toddlers
Abstract: Stunting adalah kondisi gizi kronis pada balita yang ditandai dengan pengukuran Tinggi Badan menurut Usia (HFA) di bawah ambang batas pertumbuhan standar, sehingga memerlukan deteksi dini untuk mencegah konsekuensi jangka panjang. Penelitian ini bertujuan untuk mengklasfikasikan status stunting pada balita dengan membandingkan tiga metode pembelajaran mesin: Random Forest (RF), K-Nearest Neighbor (KNN), dan Support Vector Machine (SVM). Kumpulan data terdiri dari 345 catatan balita dari puskesmas indramayu (2025), termaksut brat badan, tinggi badan, dan status gizi berdasarkan indicator WFA, HFA, dan WFH. Langkah-langkah prapemrosesan meliputi pembersian data, normalisasi Stand-ardScaler, One-Hot Encoding untuk fitur kategirikal, serta pembagian data pelatihan dan pengujian dengan rasio 80:20. Hasil perbadingan adalah KNN mencapai kinerja terbaik dengan akurasi 71,01%, presisi 0,69, recall 0,69, dan skor F1 sebesar 0,67, RF dan SVM keduanya memiliki akurasi 69,57% dengan skor F1 masing-masing sebesar 0,67 dan 0,68. Dengan demikian, KNN menunjukkan keefektifan yang lebih unggul dalam mengklasifikasikan status stunting balita dibandingkan dengan RF dan SVM pada da-taset ini.
Kata kunci: KNN; random forest; SVM; Stunting; Balita
Abstract:Abstract: The materials sector is one of the stock markets sectors that attracts investors due to the high level of construction activity in Indonesia, which supports long-term growth. Stock price movements are influenced…
d by various factors, requiring investors to determine the appropriate timing for buying, selling, or holding stocks. Therefore, this study aims to predict stock prices in the materials sector using a combination of CNN–BiLSTM algorithms. The research data were obtained from Yahoo Finance and processed through min–max normalization, data splitting, sliding window, model implementation, and evaluation stages. Testing was conducted on INTP and SMGR stocks with data split scenarios ranging from 60:40 to 90:10. The results show that CNN–BiLSTM performs best with a 90:10 data split, with minimum MSE and MAPE values of 0.000153 and 2.471% for INTP, and 0.000199 and 2.208% for SMGR, respectively. These findings indicate that increasing the proportion of training data improves the model's ability to learn historical patterns and produce more stable predictions.
Keywords: CNN-BILSTM; materials sector; stock
Abstrak: Sektor materials merupakan salah satu sektor saham yang diminati investor karena tingginya aktivitas pembangunan di Indonesia yang mendorong pertumbuhan jangka panjang. Pergerakan harga saham dipengaruhi oleh berbagai faktor sehingga investor perlu menentukan waktu transaksi yang tepat. Oleh karena itu, penelitian ini bertujuan memprediksi harga saham sektor materials menggunakan kombinasi algoritma CNN–BiLSTM. Data penelitian diperoleh dari Yahoo Finance dan diproses melalui tahapan normalisasi min–max, pembagian data, sliding window, implementasi model, serta evaluasi. Pengujian dilakukan pada saham INTP dan SMGR dengan skenario pembagian data 60:40 hingga 90:10. Hasil menunjukkan bahwa CNN–BiLSTM menghasilkan performa terbaik pada pembagian data 90:10, dengan nilai MSE dan MAPE minimum masing-masing sebesar 0.000153 dan 2.471% untuk INTP, serta 0.000199 dan 2.208% untuk SMGR. Temuan ini mengindikasikan bahwa peningkatan porsi data latih meningkatkan kemampuan model dalam mempelajari pola historis dan menghasilkan prediksi yang lebih stabil.
Kata kunci: CNN-BILSTM; saham; sektor materials
Abstract:Abstract: Malaria remains a major global health problem, particularly in tropical countries such as Indonesia. Accurate early diagnosis is essential for reducing malaria-related morbidity and mortality. Conventional microscopic…
oscopic examination is time-consuming, highly dependent on expert personnel, and prone to human error. This study compares the performance of two Convolutional Neural Network (CNN) architectures, ResNet-50 and DenseNet-121, for malaria image classification. The Cell Images for Malaria dataset provided by the National Institutes of Health (NIH) through Kaggle was used, consisting of 27,558 microscopic blood cell images categorized into Parasitized and Uninfected classes. The dataset was divided into 80% training data and 20% testing data. Image preprocessing included resizing to 224 × 224 pixels, normalization, labeling, and data augmentation using RandomFlip, RandomRotation, RandomZoom, and RandomContrast. Experimental results showed that the ResNet-50 model trained for 100 epochs achieved the highest performance, with an accuracy of 95.54% and precision, recall, and F1-score of 0.96. The confusion matrix indicated 5,272 correctly classified images out of 5,510 testing samples. These findings demonstrate that ResNet-50 outperformed DenseNet-121 and has strong potential for supporting accurate, reliable, and efficient computer-aided malaria diagnosis based on microscopic blood smear images.
Keywords: computer-aided diagnosis; convolutional neural network (CNN); densenet-121; early detection; image classification; malaria; microscopic blood smear images; resnet-50;
Abstrak : Malaria masih menjadi masalah kesehatan global yang serius, terutama di negara tropis seperti Indonesia. Diagnosis dini yang akurat sangat penting untuk menurunkan angka morbiditas dan mortalitas. Metode konvensional berupa pemeriksaan mikroskopis memiliki keterbatasan karena memerlukan waktu yang relatif lama, bergantung pada tenaga ahli, dan berpotensi menimbulkan kesalahan manusia. Penelitian ini bertujuan membandingkan kinerja arsitektur Convolutional Neural Network (CNN) yaitu ResNet-50 dan DenseNet-121 dalam klasifikasi citra malaria. Dataset yang digunakan berasal dari Cell Images for Malaria yang disediakan oleh National Institutes of Health (NIH) melalui platform Kaggle, terdiri dari 27.558 citra dengan pembagian 80% data latih, 20% data validasi. Tahap praproses meliputi cleaning, resizing citra menjadi 224×224 piksel, normalisasi, labeling, serta data augmentasi menggunakan RandomFlip, RandomRotation, RandomZoom, dan RandomContrast. Hasil pengujian menunjukkan bahwa model ResNet-50 pada epoch 100 memperoleh akurasi sebesar 95,54% dengan nilai precision, recall, dan F1-score masing-masing sebesar 0,96. Confusion matrix menunjukkan jumlah prediksi benar sebanyak 5.272 dari total 5.510 data uji. Hasil ini menunjukkan bahwa arsitektur CNN mampu mengklasifikasikan citra malaria dengan tingkat akurasi yang tinggi dan memiliki kemampuan generalisasi yang baik terhadap data baru. Penelitian ini memberikan kontribusi dalam evaluasi performa arsitektur CNN untuk mendukung pengembangan sistem diagnosis malaria berbasis citra mikroskopis yang lebih cepat dan akurat.
Kata kunci: convolutional neural network (CNN); citra mikroskopis hapusan darah; densenet-121; diagnosis berbantuan komputer; deteksi dini; klasifikasi citra; malaria; resnet-50
Abstract:Abstract: SMP Muhammadiyah 5 Samarinda still relies on manual evaluation with limited data analysis tools in predicting student academic achievement. This study aims develop a system for predicting the learning achievement…
nt of students at SMP Muhammadiyah 5 Samarinda using the Naive Bayes classification method. The dataset used consists of 192 student exam scores covering academic scores, attendance, parents’ education and income, and living conditions as independent variables, while the dependent variable is the achievement label (achieved or not achieved). The preprocessing stage includes label normalization, feature selection, and median imputation to handle missing data. The dataset was divided into 75% training data and 25%. The model was implemented as a pipeline consisting of a median imputer and a Gaussian Naive Bayes classifier. The evaluation results showed that the model achieved an accuracy of 79.2%, with a perfect recall value (1.00) in the high-achieving class and (0.64) in the low-achieving class. This shows that the model is quite effective in identifying high-achieving students. The trained model was then integrated into a Flask-based web application, which enables online predictions through a simple form interface, facilitating contextual interpretation. This system is expected to assist in educational decision-making by helping teachers identify students’ achievement levels early on and design more targeted learning interventions.
Keywords: academic performance; educational data mining; naive bayes; prediction system; student achievement
Abstrak: SMP Muhammadiyah 5 Samarinda masih bergantung pada evaluasi manual dengan alat analisis data terbatas dalam melakukan prediksi prestasi akademik siswa. Penelitian ini bertujuan mengembangkan sistem prediksi prestasi belajar siswa SMP Muhammadiyah 5 Samarinda menggunakan metode klasifikasi Naive Bayes. Dataset yang digunakan terdiri atas 192 data nilai ujian siswa yang mencakup skor akademik, kehadiran, pendidikan dan pendapatan orang tua, serta kondisi tempat tinggal sebagai variabel independen, sedangkan variabel dependen berupa label prestasi (berprestasi atau tidak berprestasi). Tahap preprocessing meliputi normalisasi label, seleksi fitur, serta imputasi median untuk menangani data yang hilang. Dataset dibagi menjadi 75% data latih dan 25%. Model diimplementasikan dalam bentuk pipeline yang terdiri atas median imputer dan Gaussian Naive Bayes classifier. Hasil evaluasi menunjukkan bahwa model mencapai akurasi sebesar 79,2%, dengan nilai recall sempurna (1,00) pada kelas berprestasi dan lebih rendah (0,64) pada kelas tidak berprestasi. Hal ini menunjukkan bahwa model cukup efektif dalam mengidentifikasi siswa berprestasi. Model yang telah dilatih kemudian diintegrasikan ke dalam aplikasi web berbasis Flask, yang memungkinkan prediksi secara daring melalui antarmuka formulir sederhana untuk mendukung interpretasi kontekstual. Sistem ini diharapkan dapat membantu untuk pengambilan keputusan dalam pendidikan dengan membantu guru mengidentifikasi tingkat prestasi siswa sejak dini dan merancang intervensi pembelajaran yang lebih terarah.
Kata kunci: prestasi akademik; penambangan data Pendidikan; naive bayes; sistem prediksi; prestasi siswa
Abstract:Abstract: MBG is a strategic program of the Prabowo-Gibran administration. This program has become a widely discussed issue in the public. To better understand public perception of this program, sentiment analysis is necessary.…
essary. This study aims to compare the performance of algorithms machine learning SVM, RF, And BERT with preprocessing data analyzing public sentiment of the MBG program in media X. The total dataset for this study was 39,858 out of 42,465 successfully crawled tweets. The research methods included data collection, preprocessing data (cleaning, case folding, word normalization, stopword removal and stemming), feature extraction, model training (fine-tuning), handling class imbalance with SMOTE, and evaluation using accuracy, precision, recall, and f1-score. The research results show that without SMOTE, the best performing models are BERT with 89% accuracy, SVM 87%, and RF 78.4%. After SMOTE, the best algorithms were SVM with 92.94%, BERT with 88.3%, and RF with 86.59%. The results confirmed that SVM is the best algorithm if at leastclass imbalance. BERT is the best algorithm before and after SMOTE, because BERT is more effective in capturing the nuances of language on social media, so BERT is the most recommended in MBG sentiment analysis.
Keywords: sentiment analysis; machine learning; SVM, RF, and BERT
Abstrak: MBG merupakan program strategis pemerintahan Prabowo - Gibran. Program ini menjadi isu yang banyak diperbincangkan publik. Untuk mengetahui lebih dalam persepsi masyrakat tentang program ini, perlu dilakukan analisis sentiment. Penelitian ini bertujuan membandingkan kinerja algoritma machine learning SVM, RF, dan BERT dengan preprocessing data menganalisis sentiment public program MBG di media X. Total dataset penelitian ini adalah 39.858 dari 42.465 tweet yang berhasil di crawling. Metode penelitian mencakup pengumpulan data, preprocessing data (cleaning, case folding, normalisasi kata, stopword removal dan stemming), ekstraksi fitur, pelatihan model (fine-tuning), penanganan class imbalance dengan SMOTE, dan evaluasi menggunakan akurasi, presisi, recall, dan f1-score. Hasil peneltian menunjukkan, tanpa SMOTE model dengan kinerja terbaik adalah BERT dengan akurasi 89%, SVM 87%, dan RF 78,4%. Setelah SMOTE algoritma terbaik adalah SVM 92,94%, BERT 88,3% dan RF 86,59%. Hasil penelitian menegaskan bahwa SVM adalah algoritma terbaik jika minimal class imbalance. BERT adalah algoritma terbaik sebelum dan sesudah SMOTE, karena BERT lebih efektif dalam menangkap nuansa bahasa pada media sosial, sehingga BERT paling di rekomendasikan dalam analisis sentimen MBG.
Kata kunci: analisis sentimen; machine learning; SVM, RF, dan BERT