Abstract:The Self-Help Housing Stimulant Assistance (BSPS) is a government house renovation program aimed at low-income communities. This program aims to enhance self-sufficiency in construction and improve the quality of houses,…
facilities, infrastructure, and public utilities through the principle of mutual cooperation. BSPS recipients must meet several criteria, such as income, house ownership status, house size, floor type, wall type, roof type, and water source. To address issues based on these criteria, Data Mining techniques using the Naive Bayes method were employed. This study utilized a dataset of BSPS recipients in Air Genting Village, Air Batu Sub-district, comprising 88 samples. The classification results from applying Naive Bayes yielded a precision value of 84%, a recall value of 81%, an F1-score of 82%, and an accuracy of 81%. The objective of this research is to facilitate the classification of eligible and rightful recipients of government assistance in the form of BSPS. The results of this study are expected to provide an alternative solution in determining BSPS recipients in Air Genting Village, Air Batu Sub-district
Abstract:Prediksi penyakit diabetes menjadi salah satu tantangan penting dalam dunia kesehatan mengingat meningkatnya prevalensi penyakit ini secara global. Penelitian ini bertujuan untuk mengimplementasikan metode Naive Bayes dalam…
lam memprediksi risiko diabetes berdasarkan dataset medis yang berisi berbagai fitur seperti usia, berat badan, kadar gula darah, tekanan darah, dan riwayat keluarga. Metode ini dipilih karena kemampuannya dalam mengolah data dengan asumsi independensi antar variabel. Pada penelitian menggunakan metode Naive Bayes menunjukkan bahwa memiliki capaian tingkat akurasi sebesar 83.75% dengan precision untuk kelas "Yes" sebesar 86.47% dan recall sebesar 93.50%, yang menandakan performa yang cukup baik dalam mendeteksi pasien diabetes. Namun, performa model dalam mendeteksi pasien non-diabetes perlu ditingkatkan mengingat recall untuk kelas "No" hanya mencapai 51.35%. Hasil ini menunjukkan bahwa Naive Bayes adalah metode yang sederhana namun efektif untuk memprediksi diabetes, dan dapat dikembangkan lebih lanjut untuk membantu pengambilan keputusan medis secara lebih akurat.
Abstract:Abstract: In this study, an analysis of the use of the Naive Bayes algorithm for sentiment analysis of reviews from Shopee app users on the Google Play Store was conducted, with classification divided into three categories:…
es: positive, negative, and neutral. To improve data quality, a preprocessing process was carried out with stages of cleaning, case folding, normalization, stop word removal, stemming, and tokenizing. Next, the text is formatted using the TF-IDF method to facilitate classification. For this data, the Naive Bayes model is used, which has an accuracy rate of 87% in detecting sentiment. Positive and negative categories can be easily identified compared to neutral sentiments due to the smaller amount of neutral data. Overall, the Naive Bayes algorithm successfully analyzed user sentiments well. The research can be developed with other algorithm methods, such as SVM, K-NN, or Decision Tree, in order to compare the performance of various algorithms.
Keywords: sentiment analysis; naive bayes; user reviews; e-commerce; shopee
Abstrak: Dalam penelitian ini dilakukan analisis penggunaan algoritma Naive Bayes untuk analisis sentimen review dari pengguna aplikasi Shopee di Google Play Store, klasifikasi dibagai menjadi 3 kategori yaitu positif, negatif, dan netral. Untuk meningkatkan kualitas data, dilakukam proses preprocessing dengan tahap cleanimg, case folding, normalisasi, stopword removal, stemming, dan tekonezing. Selanjutnya, teks diformat menggunakan metode TF-IDF untuk memudahkan klasifikasi. Untuk data ini, model Naive Bayes digunakan, yang memiliki tingkat akurasi 87% dalam mendeteksi sentimen. Kategori positif dan negatif dapat dengan mudah diidentifikasi dibadingkan sentiemen netral karena jumlah data netral yang lebih sedikit. Secara keseluruhan, algoritma Naive Bayes berhasil menganalisis perasaan pengguna dengan baik. Penelitian dapat dikembangkan dengan algoritma metode lain, seperti SVM, K-NN, atau Decision Tree, guna membandingkan kinerja berbagai algoritma.
Kata kunci: analisis sentiment; naive bayes; ulasan pengguna; e-commerce; shopee
Abstract:Tujuan penelitian ini adalah untuk mengetahui cara menganalisis sentimen dari ulasan pengguna pada game Roblox dan untuk mengetahui hasil perbandingan performa klasifikasi dengan menggunakan metode Support Vector Machine…
Dan Naive Bayes dalam menganalisis sentimen ulasan pengguna pada game Roblox. Data yang digunakan pada penelitian ini berjumlah sebanyak 10000 record data ulasan yang di ambil pada tanggal 15 Juni 2024. Hasil yang di peroleh dalam menganalisis sentimen data ulasan pada aplikasi Roblox cenderung mendapatkan sentimen positif dengan persentase 65,06% sedangkan untuk sentimen negatif dengan persentase 34,94%. Support Vector Machine merupakan algoritma terbaik dalam menganalisis sentimen data ulasan pada aplikasi Roblox dengan tingkat akurasi yang paling tinggi pada perbandingan data 90:10 yaitu 90 %, untuk precision, recall, dan f1-score yang dihasilkan pada sentimen positif yaitu 88%, 85%, dan 86%, sedangkan pada sentimen negatif adalah 91%, 93%, dan 92%. Algoritma Naïve Bayes mendapatkan tingkat akurasi yang paling tinggi pada perbandingan data 90:10 yaitu 72,4%, untuk precision, recall, dan f1-score yang dihasilkan pada sentimen positif yaitu 88%, 34%, dan 49%, sedangkan pada sentimen negatif adalah 70%, 97%, dan 81%.
Abstract:Pemerintah Indonesia menghadapi sejumlah problematika dalam bidang perekonomian, memerlukan solusi tepat untuk meningkatkan kondisi ekonomi. Keterlibatan langsung pemerintah dalam merespon dan memecahkan masalah tersebut…
memerlukan pemahaman mendalam terhadap problematika yang dihadapi masyarakat. Pasar, sebagai pusat ekonomi, mengalami transformasi signifikan dengan adanya platform online seperti TikTok, yang sebelumnya menyediakan fitur belanja yang populer. Dalam menghadapi dampak positif dan negatif dari fitur belanja TikTok, pemerintah memutuskan untuk menutup fitur tersebut. Penelitian ini bertujuan untuk menganalisis sentimen masyarakat terhadap kebijakan tersebut menggunakan Lexicon Based sebagai metode pelabelan, serta Naïve Bayes dan Random Forest sebagai model klasifikasi. Dengan menggunakan teknik crawling data, penelitian ini akan menyajikan analisis sentimen untuk memahami pandangan masyarakat terkait penutupan fitur belanja TikTok dan implikasinya terhadap perekonomian Indonesia.
Abstract:Abstract: Getting a job is a goal by graduates after completing their studies. But in this process, getting a job inevitably requires waiting time. If one measure of success in the field of education of a tertiary institution…
ution is the number of graduates entering the workforce. So to implement this goal, alumni data is needed that can be used in decision making. Existing tracer study data at the STMIK Royal Career Service Center (LPLK) have not been utilized optimally by the campus. If we dig deeper, we will get some knowledge from this data by applying data mining techniques. Therefore, it is clear that using data mining to predict alumni waiting time is important for a university to determine its strategy. The purpose of this study is to predict the waiting time for alumni to get a job using data mining by applying the Naive Bayes algorithm. Training and testing data were taken from 193 data tracer study alumni of STMIK Royal in 2021 who had graduated and were working. The criteria used to predict alumni waiting time are gender, major, year of entry, year of graduation, GPA, and length of time getting a job. The results of modeling using the Naive Bayes algorithm produce an accuracy of 94%.
Keyword: data mining; naive bayes; waiting time
Abstrak: Mendapatkan pekerjaan merupakan tujuan oleh lulusan setelah menyelesaikan studi mereka. Tetapi dalam proses ini, mendapatkan pekerjaan pasti membutuhkan waktu tunggu. Jika salah satu ukuran keberhasilan di bidang pendidikan suatu perguruan tinggi adalah banyaknya lulusan yang masuk ke dunia kerja. Maka untuk menerapkan tujuan itu, maka diperlukan data alumni yang dapat digunakan dalam pengambilan keputusan. Data tracer study yang ada di Lembaga Pusat Layanan Karir (LPLK) STMIK Royal belum dimanfaatkan secara optimal oleh kampus. Jika kita gali lebih dalam, kita akan mendapatkan suatu pengetahuan dari data ini dengan menerapkan teknik data mining. Oleh karena itu, jelas bahwa menggunakan data mining untuk memprediksi waktu tunggu alumni penting bagi suatu perguruan tinggi untuk menentukan strateginya. Tujuan dari penelitian ini adalah untuk memprediksi waktu tunggu alumni mendapatkan pekerjaan menggunakan data mining dengan menerapkan algoritma naive bayes. Data training dan testing diambil dari 193 data tracer study alumni STMIK Royal tahun 2021 yang sudah lulus dan bekerja. Kriteria yang digunakan untuk memprediksi waktu tunggu kerja alumni yaitu jenis kelamin, jurusan, tahun masuk, tahun lulus, IPK, dan lama mendapatkan pekerjaan. Hasil pemodelan dengan menggunakan algoritma naive bayes menghasilkan akurasi sebesar 94%.
Kata Kunci: data mining; naive bayes; waktu tunggu
Abstract:Abstract : The Central Bureau of Statistics (BPS) is a non-departmental government agency established as a provider of data or information based on Law No. 6/1960 on Census and Law No. 7/1997 on Statistics. The Central Statistics…
tatistics Agency (BPS) recorded the number of motorized vehicles such as cars, buses, trucks, and motorcycles in the provinces of North Sumatra and West Sumatra in 2020-2021 reaching 3,043,892 million units. The purpose of this study is to classify the number of motorized vehicles in the form of cars, motorcycles, buses and trucks. This research uses quantitative research with Naive Bayes Algorithm analysis model. The data used in this study is data from several regions in North Sumatra Province and West Sumatra Province in 2020-2021. Evaluation of model performance is based on accuracy parameters, precision and total recall of the confusion-matrix. The results of testing the dataset and calculating the model performance parameters have obtained an accuracy value of 100%. With the percentage value of the description of each dataset class, namely a little 70.6%, moderate 21.6%, and a lot 7.8%.
Keywords :classification;confusion-matrix; data; motor vehicles; naive bayes
Abstrak : Badan Pusat Statistik (BPS) adalah lembaga pemerintahan non-departemen yang dibentuk sebagai penyedia data atau informasi berdasarkan UU Nomor 6 Tahun 1960 tentang Sensus dan UU Nomor 7 Tahun 1997 tentang Statistik. Badan Pusat Statistik (BPS) mencatat jumlah kendaraan bermotor seperti mobil, bus, truk, dan sepeda motor di Provinsi Sumatera Utara dan Sumatera Barat pada tahun 2020-2021 mencapai 3.043.892 juta unit. Tujuan dari penelitian ini yaitu untuk mengklasifikasikan jumlah kendaraan bermotor berupa mobil, sepeda motor, bus dan, truk. Adapun penelitian ini menggunakan jenis penelitian kuantitatif dengan model analisis Algoritma Naive Bayes. Data yang digunakan pada penelitian ini adalah data dari beberapa daerah di Provinsi Sumatera Utara dan Provinsi Sumatera Barat tahun 2020-2021. Evaluasi kinerja model didasarkan pada parameter akurasi, presisi dan recall total dari Confusion-Matrix. Hasil pengujian dataset dan perhitungan parameter performa model telah didapat nilai akurasi 100%. Dengan presentase nilai keterangan setiap kelas dataset yaitu Sedikit 70,6%, Sedang 21,6%, dan Banyak 7,8%.
Kata kunci :confusion-matrix; data; kendaraan bermotorklasifikasi; naive bayes
Abstract:Abstract: The Family Hope Program (PKH) is a government program in the form of cash for Very Poor Households (RTSM) whose qualifications are met related to efforts to improve human quality, not in the field of education…
but also health. In the short term, the PKH program is calculated to reduce the expenditure of poor families and reduce poverty in the long term. To receive the PKH Program) the government has set several criteria, including income, house ownership status, house size, floor type, roof, wall, and type of water source. As for the way to do the settlement of the criteria that have been set, namely by utilizing the Data Mining technique through the Naïve Bayes method. The dataset in this study is the data of recipients of the 2020 Family Hope Program as many as 82 samples. The results of the classification modeling with the Naïve Bayes Algorithm produce precision values for the positive class 100%, for the negative class 77%, the recall value for the positive class 80%, for the negative class 100%, the f1-score value for the positive class 89%, for the negative class 87%, and 88% accuracy value. The purpose of this research is to help the Social Service in classifying the recipients of the Family Hope Program (PKH).
Keywords: The Family Hope Program; Data Mining; Naïve Bayes
Abstrak: Program Keluarga Harapan (PKH) merupakan program pemerintah dalam bentuk tunai untuk Rumah Tangga Sangat Miskin (RTSM) yang kualifikasinya terpenuhi terkait dengan upaya peningkatan kualitas manusia tersebut bukan dalam bidang pendidikan tetapi juga kesehatan. dalam jangka pendek Program PKH diperhitungkan bisa mengurangi biaya pengeluaran keluarga miskin serta mengurangi kemiskinan dalam jangka panjang. Untuk menerima Program PKH) pemerintah sudah menetapkan beberapa kriteria, diantaranya Penghasilan, Status Kepemilikan Rumah, Ukuran Rumah, tipe Lantai, Atap, Dinding, serta jenis sumber air. Adapun cara untuk melakukan penyelesaian terhadap kriteria yang sudah ditetapkan yaitu dengan memanfaatkan teknik Data Mining melalui Metode Naïve Bayes. Dataset dalam penelitian ini adalah data penerima Program Keluarga Harapan tahun 2020 sebanyak 82 sampel. Hasil pemodelan klasifikasi dengan Algoritma Naïve Bayes menghasilkan besaran nilai precision untuk kelas positif 100%, untuk kelas negatif 77%, nilai recall untuk kelas positif 80%, untuk kelas negatif 100%, nilai f1-score untuk kelas positif 89%, untuk kelas negatif 87%, dan nilai akurasi 88%. Tujuan dilaksanakannya penelitian ini adalah untuk membantu Dinas Sosial mengklasifikasikan penerima Program Keluarga Harapan (PKH).
Kata kunci: Program Keluarga Harapan; Data Mining; Naïve Bayes
Abstract:Abstract: The rapid growth of e-commerce mobile applications has generated large volumes of user reviews, making manual sentiment analysis increasingly impractical. This study aims to compare the effectiveness of three machine…
achine learning algorithms Support Vector Machine (SVM), Random Forest, and Naive Bayes for automated sentiment classification of Indonesian-language mobile application reviews. A dataset of 3,000 user reviews from the RupaRupa application on the Google Play Store was collected and preprocessed through normalization, tokenization, stopword removal, and stemming. TF-IDF vectorization was applied for feature extraction, while the Synthetic Minority Over-sampling Technique (SMOTE) was used to address class imbalance across three sentiment categories: positive, negative, and neutral. The results show that SVM achieved the highest accuracy of 90.02%, while Random Forest obtained the best F1-score of 88.08% when sufficient training data were available. Naive Bayes demonstrated relatively stable performance across varying training data sizes. Furthermore, TF-IDF keyword analysis revealed that negative reviews were primarily associated with delivery issues, technical problems, and pricing concerns. These findings demonstrate the effectiveness of machine learning approaches for sentiment classification and provide practical insights for improving mobile application services.
Keywords: sentiment analysis; machine learning; SMOTE; TF-IDF; text classification
Abstrak: Pertumbuhan pesat aplikasi mobile e-commerce telah menghasilkan volume ulasan pengguna yang sangat besar, sehingga analisis sentimen secara manual menjadi semakin tidak praktis. Penelitian ini bertujuan untuk membandingkan efektivitas tiga algoritma machine learning Support Vector Machine (SVM), Random Forest, dan Naive Bayes dalam melakukan klasifikasi sentimen otomatis terhadap ulasan aplikasi mobile berbahasa Indonesia. Dataset yang digunakan terdiri dari 3.000 ulasan pengguna aplikasi RupaRupa yang dikumpulkan dari Google Play Store. Data kemudian diproses melalui tahapan preprocessing yang meliputi normalisasi, tokenisasi, penghapusan stopword, dan stemming. Ekstraksi fitur dilakukan menggunakan metode Term Frequency–Inverse Document Frequency (TF-IDF), sedangkan ketidakseimbangan kelas ditangani menggunakan Synthetic Minority Over-sampling Technique (SMOTE) pada tiga kategori sentimen, yaitu positif, negatif, dan netral. Hasil penelitian menunjukkan bahwa SVM mencapai tingkat akurasi tertinggi sebesar 90,02%, sementara Random Forest memperoleh nilai F1-score terbaik sebesar 88,08% ketika tersedia data pelatihan yang memadai. Naive Bayes menunjukkan performa yang relatif stabil pada berbagai ukuran data pelatihan. Selain itu, analisis kata kunci berbasis TF-IDF mengungkapkan bahwa ulasan negatif terutama berkaitan dengan masalah pengiriman, kendala teknis aplikasi, dan isu harga. Temuan ini menunjukkan bahwa pendekatan machine learning efektif untuk klasifikasi sentimen serta memberikan wawasan yang bermanfaat dalam meningkatkan kualitas layanan aplikasi mobile.
Kata Kunci: analisis sentimen; pembelajaran mesin; SMOTE; TF-IDF; klasifikasi teks.
Abstract:Abstract: The growing intensity of cyber attacks, marked by rapid, large-scale, automated, and adaptive execution, requires analytical methods that represent the diversity of network environments, including variations in…
target platforms such as IoT, traditional networks, and hybrid infrastructures. This study compares machine learning models for cyber attack classification under heterogeneous environmental conditions and formulates a conceptual optimization framework based on model performance. Four publicly available benchmark datasets were used, namely UNB CIC IoT 2023, UNB CIC IDS-2018, UNSW-NB15, and a Kaggle cyber security attacks dataset, comprising approximately 40,000 to over 3.6 million records and 25 to 80 features across IoT, conventional, and mixed network environments. Random Forest, XGBoost, Multilayer Perceptron, and Transformer were implemented within a unified pipeline involving preprocessing, feature selection, and Bayesian Optimization-based hyperparameter tuning. All models achieved F1-score and Cohen's Kappa above 96%, with XGBoost performing best (97.80%, 97.26%), followed by Random Forest (97.78%, 96.96%) and Transformer (97.44%, 96.82%), while MLP scored lowest (96.74%, 96.00%), a gap below one percentage point. Confusion matrix analysis revealed persistent misclassification in minority and overlapping attack classes, informing a proposed adaptive cyber attack simulation optimization framework.
Keywords: cyber attacks; optimization; machine learning; environmental variability.
Abstrak: Meningkatnya intensitas serangan siber yang berlangsung cepat, masif, otomatis, dan adaptif menuntut pendekatan analitis yang merepresentasikan keragaman lingkungan jaringan, termasuk perbedaan karakteristik platform sasaran seperti Internet of Things (IoT), jaringan konvensional, dan infrastruktur hibrida. Penelitian ini membandingkan model machine learning untuk klasifikasi serangan siber pada kondisi lingkungan heterogen, sekaligus menyusun kerangka optimasi konseptual berdasarkan performa model. Empat dataset benchmark publik digunakan, yaitu UNB CIC IoT 2023, UNB CIC IDS-2018, UNSW-NB15, serta dataset Kaggle cyber security attacks, dengan jumlah data berkisar 40.000 hingga lebih dari 3,6 juta rekaman dan 25 sampai 80 fitur, mewakili lingkungan IoT, konvensional, dan campuran. Random Forest, XGBoost, Multilayer Perceptron, dan Transformer diimplementasikan melalui pipeline terpadu mencakup pra-pemrosesan, seleksi fitur, dan optimasi hyperparameter berbasis Bayesian Optimization. Seluruh model mencapai F1-score dan Cohen's Kappa di atas 96%, dengan XGBoost menunjukkan performa terbaik (97,80%, 97,26%), diikuti Random Forest (97,78%, 96,96%) dan Transformer (97,44%, 96,82%), sementara MLP mencatat skor terendah (96,74%, 96,00%), dengan selisih kurang dari satu poin persentase. Analisis confusion matrix mengungkap misklasifikasi yang konsisten pada kelas minoritas dan serangan dengan karakteristik serupa, yang menjadi dasar kerangka optimasi simulasi serangan siber adaptif yang diusulkan.
Kata kunci: serangan siber; optimasi; machine learning; variabilitas lingkungan