Abstract:Abstract: Existing IoT anomaly detection studies have achieved high classification performance, but most focus on accuracy and F1-score without explicitly controlling the false positive rate (FPR). In addition, many approaches…
oaches rely on a single detection perspective, limiting their operational reliability. To address this gap, this study proposes a hybrid anomaly detection framework integrating Long Short-Term Memory (LSTM), Shannon entropy, and autoencoder reconstruction error. Shannon entropy is incorporated as an additional feature, while LSTM and the autoencoder capture temporal and reconstruction characteristics. The resulting hybrid representation is processed by a constraint-based threshold selection mechanism that enforces FPR . Experiments on the TON-IoT and Edge-IIoTset datasets achieved average F1-scores of 0.9250 and 0.9934, while maintaining average FPR values of 0.0091 and 0.0714, respectively. Analysis of entropy distributions showed consistent differences between normal and anomalous traffic across both datasets, indicating that Shannon entropy provides discriminative information for anomaly detection. These results demonstrate strong detection performance with controlled false alarms, while ablation studies confirm the significant contribution of Shannon entropy to overall model performance.
Keywords: false positive rate; hybrid deep learning; Internet of Things; network anomaly detection; Shannon entropy
Abstrak: Penelitian deteksi anomali Internet of Things (IoT) telah menunjukkan performa klasifikasi yang tinggi, namun sebagian besar masih berfokus pada accuracy dan F1-score tanpa mengendalikan false positive rate (FPR) secara eksplisit. Selain itu, banyak pendekatan hanya memanfaatkan satu perspektif deteksi sehingga reliabilitas operasionalnya masih terbatas. Untuk mengatasi kesenjangan tersebut, penelitian ini mengusulkan kerangka deteksi anomali hybrid yang mengintegrasikan Long Short-Term Memory (LSTM), Shannon entropy, dan autoencoder reconstruction error. Shannon entropy digunakan sebagai fitur tambahan, sedangkan LSTM dan autoencoder menangkap karakteristik temporal dan deviasi rekonstruksi. Representasi hybrid yang dihasilkan kemudian diproses melalui mekanisme constraint-based threshold selection dengan batas FPR . Hasil pengujian pada dataset TON-IoT dan Edge-IIoTset menghasilkan F1-score rata-rata sebesar 0,9250 dan 0,9934, dengan FPR rata-rata sebesar 0,0091 dan 0,0714. Perbedaan nilai entropy yang konsisten antara trafik normal dan anomali pada kedua dataset menunjukkan bahwa Shannon entropy menyediakan informasi diskriminatif untuk deteksi anomali. Hasil tersebut menunjukkan performa deteksi yang kuat dengan false alarm yang terkendali, sementara studi ablasi mengonfirmasi kontribusi signifikan Shannon entropy terhadap performa model.
Kata kunci: deteksi anomali jaringan; false positive rate; hybrid deep learning; Internet of Things; Shannon entropy
Abstract:Abstract: Anomalous sound detection is essential for industrial predictive maintenance, as machine failures often originate from subtle acoustic changes during operation. However, high background noise and limitations of…
conventional Convolutional Neural Networks (CNN) reduce detection reliability. This study proposes a 1D-CNN-based anomaly detection framework with multi-view feature fusion and temporal segmentation to enhance detection performance. The approach combines MFCC, Log-Mel Spectrogram, and Chroma STFT features, while temporal segmentation divides audio signals into 5-second segments to better capture transient anomalies. Experiments on the MIMII dataset under varying Signal-to-Noise Ratio (SNR) conditions show that MFCC and Log-Mel fusion achieves the best performance, with 97.90% accuracy and ROC-AUC of 0.9789. The model maintains accuracy above 90% at −6 dB, demonstrating strong robustness in noisy industrial environments.
Keywords: industrial anomaly detection; 1D-CNN; multi-view feature fusion; temporal segmentation; MIMII dataset.
Abstrak: Deteksi anomali suara merupakan komponen penting dalam sistem pemeliharaan prediktif industri, karena kegagalan mesin sering diawali oleh perubahan akustik yang bersifat halus selama proses operasi. Namun, tingkat kebisingan yang tinggi serta keterbatasan arsitektur Convolutional Neural Network (CNN) konvensional dapat menurunkan keandalan deteksi. Penelitian ini bertujuan mengusulkan kerangka deteksi anomali berbasis 1D-CNN yang mengintegrasikan strategi fusi fitur multi-view dan segmentasi temporal untuk meningkatkan kinerja deteksi. Pendekatan yang digunakan menggabungkan fitur MFCC, Log-Mel Spectrogram dan Chroma STFT, sementara teknik temporal splitting membagi sinyal audio menjadi segmen berdurasi 5 detik untuk menangkap anomali yang bersifat sementara. Eksperimen menggunakan dataset MIMII pada berbagai kondisi Signal-to-Noise Ratio (SNR) menunjukkan bahwa kombinasi MFCC dan Log-Mel Spectrogram menghasilkan kinerja terbaik dengan akurasi 97,90% dan ROC-AUC sebesar 0,9789. Model juga mempertahankan akurasi di atas 90% pada kondisi kebisingan ekstrem (−6 dB) yang menunjukkan ketahanan yang baik dalam lingkungan industri yang bising.
Kata kunci: deteksi anomali industri; 1D-CNN; fusi fitur multi-view; segmentasi temporal; dataset MIMII
Abstract:Abstract: The development of globalization and digitalization requires businesses to not only focus on product quality, but also on the ability to build and maintain long-term relationships with customers. Customer loyalty…
ty has become a strategic asset that influences business sustainability and competitiveness. Handmade Willy, a creative business engaged in the production and sale of handicrafts, faces various problems in customer management, such as difficulties in identifying customer preferences, limitations in ongoing communication, suboptimal customer segmentation, and the absence of a structured system for monitoring customer satisfaction and feedback. These problems have an impact on the ineffectiveness of marketing strategies and the potential decline in customer loyalty. This study aims to optimize customer relationships at Handmade Willy through the application of the Customer Relationship Management (CRM) concept. The research method used is descriptive analysis with a qualitative approach through data collection from observation, interviews, and literature studies. The blackbox testing results show that the system runs smoothly without any obstacles. The implementation of CRM helps Handmade Willy understand customer characteristics and preferences, perform more accurate segmentation, improve communication effectiveness, and systematically monitor customer satisfaction.
Keyword: customer loyalty; customer relationship management; handmade willy.
Abstrak: Perkembangan era globalisasi dan digitalisasi menuntut pelaku usaha untuk tidak hanya berfokus pada kualitas produk, tetapi juga pada kemampuan membangun dan mempertahankan hubungan jangka panjang dengan pelanggan. Loyalitas pelanggan menjadi aset strategis yang berpengaruh terhadap keberlanjutan dan daya saing bisnis. Handmade Willy sebagai usaha kreatif yang bergerak di bidang produksi dan penjualan kerajinan tangan menghadapi berbagai permasalahan dalam pengelolaan pelanggan seperti kesulitan dalam mengidentifikasi preferensi pelanggan, keterbatasan komunikasi berkelanjutan, belum optimalnya segmentasi pelanggan serta belum adanya sistem yang terstruktur untuk memantau kepuasan dan umpan balik pelanggan. Permasalahan tersebut berdampak pada kurang efektifnya strategi pemasaran dan potensi penurunan loyalitas pelanggan. Penelitian ini bertujuan untuk mengoptimalkan hubungan pelanggan pada Handmade Willy melalui penerapan konsep Customer Relationship Management (CRM). Metode penelitian yang digunakan adalah analisis deskriptif dengan pendekatan kualitatif melalui pengumpulan data observasi, wawancara dan studi literatur. Hasil pengujian blackbox menunjukkan sistem yang dibuat berjalan dengan lancar tanpa ada kendala. Dengan penerapan CRM mampu membantu Handmade Willy dalam memahami karakteristik dan preferensi pelanggan, melakukan segmentasi yang lebih tepat, meningkatkan efektivitas komunikasi serta memantau kepuasan pelanggan secara sistematis.
Kata kunci: customer relationship management; kerajinan tangan willy; loyalitas pelanggan.
Abstract:Abstract: The growing intensity of cyber attacks, marked by rapid, large-scale, automated, and adaptive execution, requires analytical methods that represent the diversity of network environments, including variations in…
target platforms such as IoT, traditional networks, and hybrid infrastructures. This study compares machine learning models for cyber attack classification under heterogeneous environmental conditions and formulates a conceptual optimization framework based on model performance. Four publicly available benchmark datasets were used, namely UNB CIC IoT 2023, UNB CIC IDS-2018, UNSW-NB15, and a Kaggle cyber security attacks dataset, comprising approximately 40,000 to over 3.6 million records and 25 to 80 features across IoT, conventional, and mixed network environments. Random Forest, XGBoost, Multilayer Perceptron, and Transformer were implemented within a unified pipeline involving preprocessing, feature selection, and Bayesian Optimization-based hyperparameter tuning. All models achieved F1-score and Cohen's Kappa above 96%, with XGBoost performing best (97.80%, 97.26%), followed by Random Forest (97.78%, 96.96%) and Transformer (97.44%, 96.82%), while MLP scored lowest (96.74%, 96.00%), a gap below one percentage point. Confusion matrix analysis revealed persistent misclassification in minority and overlapping attack classes, informing a proposed adaptive cyber attack simulation optimization framework.
Keywords: cyber attacks; optimization; machine learning; environmental variability.
Abstrak: Meningkatnya intensitas serangan siber yang berlangsung cepat, masif, otomatis, dan adaptif menuntut pendekatan analitis yang merepresentasikan keragaman lingkungan jaringan, termasuk perbedaan karakteristik platform sasaran seperti Internet of Things (IoT), jaringan konvensional, dan infrastruktur hibrida. Penelitian ini membandingkan model machine learning untuk klasifikasi serangan siber pada kondisi lingkungan heterogen, sekaligus menyusun kerangka optimasi konseptual berdasarkan performa model. Empat dataset benchmark publik digunakan, yaitu UNB CIC IoT 2023, UNB CIC IDS-2018, UNSW-NB15, serta dataset Kaggle cyber security attacks, dengan jumlah data berkisar 40.000 hingga lebih dari 3,6 juta rekaman dan 25 sampai 80 fitur, mewakili lingkungan IoT, konvensional, dan campuran. Random Forest, XGBoost, Multilayer Perceptron, dan Transformer diimplementasikan melalui pipeline terpadu mencakup pra-pemrosesan, seleksi fitur, dan optimasi hyperparameter berbasis Bayesian Optimization. Seluruh model mencapai F1-score dan Cohen's Kappa di atas 96%, dengan XGBoost menunjukkan performa terbaik (97,80%, 97,26%), diikuti Random Forest (97,78%, 96,96%) dan Transformer (97,44%, 96,82%), sementara MLP mencatat skor terendah (96,74%, 96,00%), dengan selisih kurang dari satu poin persentase. Analisis confusion matrix mengungkap misklasifikasi yang konsisten pada kelas minoritas dan serangan dengan karakteristik serupa, yang menjadi dasar kerangka optimasi simulasi serangan siber adaptif yang diusulkan.
Kata kunci: serangan siber; optimasi; machine learning; variabilitas lingkungan
Abstract:Abstract: Human metapneumovirus (HMPV) poses a global health threat, but its detection remains challenging due to limited environmental monitoring. This study aims to develop a portable diagnostic tool for rapid HMPV detection…
ection by integrating cutting-edge biotechnology (CRISPR-Cas system and immunoassay) with air quality sensors on an Internet of Things (IoT)-based microfluidic platform controlled by an ESP32 microcontroller. The system is supported by a companion application and data analysis using Vertex AI, and is capable of providing results in less than fifteen minutes. The development results demonstrate the potential for improving detection accuracy and reliability, particularly with further development of virus-specific biosensors, sensor optimization, and algorithms. This technology is effective as a complementary tool for early screening and environment-based risk management in areas with limited laboratory facilities, although it does not completely replace molecular diagnostic methods such as PCR. A rapid diagnostic approach based on environmental sensors, IoT, and artificial intelligence is a promising strategy to improve early HMPV detection, accelerate public health responses, and strengthen respiratory infection prevention through integrated environmental monitoring and education functions.
Keywords: air quality; CRISPR-Cas; Human Metapneumovirus (HMPV); Internet of Things, portable diagnostic; public health; rapid detection; sensors.
Abstrak: Human metapneumovirus (HMPV) merupakan ancaman bagi kesehatan global, namun pendeteksiannya masih sulit akibat keterbatasan pemantauan lingkungan. Studi ini bertujuan mengembangkan alat diagnostik portabel untuk deteksi cepat HMPV melalui integrasi bioteknologi mutakhir (sistem CRISPR-Cas dan immunoassay) dengan sensor kualitas udara pada platform mikrofluida berbasis Internet of Things (IoT) yang dikendalikan mikrokontroler ESP32. Sistem ini didukung aplikasi pendamping dan analisis data menggunakan Vertex AI, serta mampu memberikan hasil dalam waktu kurang dari lima belas menit. Hasil pengembangan menunjukkan potensi peningkatan akurasi dan keandalan deteksi, terutama dengan pengembangan lanjutan berupa biosensor spesifik virus, optimalisasi sensor, dan algoritma. Teknologi ini efektif sebagai alat pelengkap untuk skrining awal dan manajemen risiko berbasis lingkungan di wilayah dengan keterbatasan fasilitas laboratorium, meskipun tidak sepenuhnya menggantikan metode diagnostik molekuler seperti PCR. Pendekatan diagnostik cepat berbasis sensor lingkungan, IoT, dan kecerdasan buatan menjadi strategi menjanjikan untuk meningkatkan deteksi dini HMPV, mempercepat respons kesehatan masyarakat, serta memperkuat pencegahan infeksi saluran pernapasan melalui fungsi pemantauan dan edukasi lingkungan yang terintegrasi.
Kata kunci: CRISPR-Cas; diagnostik portabel; deteksi cepat; Human Metapneumovirus (HMPV); kesehatan masyarakat; IoT (Internet of Things); sensor kualitas udara.
Abstract:Abstract: Mental health is an essential aspect of overall well-being, particularly for university students vulnerable to emotional strain. This study aims to identify clusters of student mental health trends using the K-Means…
Means clustering technique. The research involved 60 students from four academic programs at the Faculty of Science and Technology, selected using stratified and cluster sampling techniques. Data were collected using a modified Mental Health Inventory (MHI). The results revealed distinct commonalities among majors: the Statistics program was predominantly defined by the depressed cluster at 53.3%, while Mathematics followed at 40% within the same cluster. In contrast, Biology students predominantly fell under the neu-tral/stable cluster (66.7%), whilst Information Systems students exhibited an even distribution (33.3% per cluster) without a dominant trend. The clustering quality was evaluated using the Silhouette Coefficient, yielding a range of 0.39 to 0.60. Biology (0.60) and Statistics (0.54) exhibited a reasonable structure, but Information Systems (0.39) and Mathematics (0.34) demonstrated a deficient structure. In conclusion, K-Means effectively discerns mental health patterns, providing a data-driven basis for targeted psychological interventions in educational settings.
Keywords: biology; information systems; k-means; mathematics; mental health; silhouette coefficient; statistics
Abstrak: Kesehatan mental merupakan komponen vital dari kesejahteraan total, terutama bagi maha-siswa yang rentan terhadap stres emosional. Penelitian ini bertujuan untuk mengidentifikasi kelompok tren kesehatan mental mahasiswa melalui penerapan metode pengelompokan K-Means. Studi ini mencakup 60 mahasiswa dari empat program studi di Fakultas Sains dan Teknologi, yang dipilih melalui metode pengambilan sampel bertingkat dan kelompok. Data dikumpulkan dengan menggunakan Inventaris Kesehatan Mental (MHI) yang dimodifikasi. Temuan menunjukkan kesamaan yang jelas di antara jurusan: program studi Statistika terutama ditandai oleh kelompok depresi (53,3%), diikuti oleh Matematika dengan 40% dalam kelompok depresi. Sebaliknya, mahasiswa Biologi terutama termasuk dalam kelompok netral/stabil (66,7%), sedangkan mahasiswa Sistem Informasi memiliki distribusi yang merata (33,3% per kelompok) tanpa pola yang dominan. Kualitas pengelompokan dinilai dengan Koefisien Sil-houette, menghasilkan rentang 0,39 hingga 0,60. Biologi (0,60) dan Statistika (0,54) memiliki struktur sedang, sedangkan Sistem Informasi (0,39) dan Matematika (0,34) menunjukkan struktur yang buruk. Kesimpulannya, K-Means secara akurat mengidentifikasi tren kesehatan mental, menawarkan landasan berbasis data untuk terapi psikologis yang ditargetkan di ling-kungan pendidikan.
Kata kunci: biologi; kesehatan mental; K-Means; matematika; silhouette coefficient; sistem in-formasi; statistika
Abstract:Abstract: Accurate bone age estimation is essential for monitoring pediatric growth, diagnosing endocrine disorders, and supporting clinical decision-making. Although deep learning has improved prediction accuracy, limited…
ed studies have systematically examined how increasing model depth affects performance and reliability. This study evaluates the effectiveness of progressively deeper convolutional neural networks, specifically EfficientNet variants B0 to B5, for bone age estimation from hand radiographs. Experiments were conducted using 12,611 hand X-ray images from the RSNA Pediatric Bone Age Challenge dataset on Kaggle. To ensure fair comparison, all models were trained using a unified and consistent training pipeline. Model performance was evaluated using Mean Absolute Error (MAE), Mean Absolute Percentage Error (MAPE), Concordance Correlation Coefficient (CCC), and Pearson correlation coefficient. The results show a consistent improvement in prediction accuracy as model depth increases. Among the evaluated models, EfficientNet-B5 achieved the best performance, with an MAE of 21.5 months, MAPE of 6.23%, CCC of 0.9148, and Pearson’s r of 0.9203. These findings confirm that model scaling plays a critical role in enhancing prediction robustness and clinical reliability. Future work should emphasize external validation across diverse populations and incorporate interpretability techniques, such as Grad-CAM, to improve clinical transparency and trust.
Keywords: bone age prediction; deep learning; model evaluation; clinical validation
Abstrak: Estimasi usia tulang yang akurat sangat penting untuk memantau pertumbuhan anak, mendiagnosis gangguan endokrin, dan mendukung pengambilan keputusan klinis. Meskipun pembelajaran mendalam telah meningkatkan akurasi prediksi, studi yang secara sistematis meneliti bagaimana peningkatan kedalaman model memengaruhi kinerja dan keandalan masih terbatas. Studi ini mengevaluasi efektivitas jaringan saraf konvolusional yang semakin dalam, khususnya varian EfficientNet B0 hingga B5, untuk estimasi usia tulang dari radiografi tangan. Eksperimen dilakukan menggunakan 12.611 gambar sinar-X tangan dari dataset RSNA Pediatric Bone Age Challenge di Kaggle. Untuk memastikan perbandingan yang adil, semua model dilatih menggunakan alur pelatihan yang terpadu dan konsisten. Kinerja model dievaluasi menggunakan Mean Absolute Error (MAE), Mean Absolute Percentage Error (MAPE), Concordance Correlation Coefficient (CCC), dan koefisien korelasi Pearson. Hasil menunjukkan peningkatan yang konsisten dalam akurasi prediksi seiring dengan peningkatan kedalaman model. Di antara model yang dievaluasi, EfficientNet-B5 mencapai kinerja terbaik, dengan MAE sebesar 21,5 bulan, MAPE sebesar 6,23%, CCC sebesar 0,9148, dan Pearson’s r sebesar 0,9203. Temuan ini menegaskan bahwa penskalaan model memainkan peran penting dalam meningkatkan optimasi prediksi dan keandalan klinis. Penelitian selanjutnya dapat menekankan validasi eksternal di berbagai populasi dan menggabungkan teknik interpretasi, seperti Grad-CAM, untuk meningkatkan transparansi dan kepercayaan klinis.
Kata kunci: prediksi usia tulang; deep learning; evaluasi model; validasi klinis
Abstract:Abstract: Tourism in Pati Regency currently lacks an integrated digital information system, resulting in suboptimal dissemination of information and trip planning. To address this issue, a tourism website for Pati Regency…
y was developed, equipped with a recommended tourist route feature. This study aims to design and develop a web-based tourism information system that provides destination information based on categories, media galleries, and promotional YouTube videos, as well as a Patiways feature that allows users to select multiple tourist destinations. The system then calculates the most efficient visiting order using a greedy heuristic algorithm, based on the selected starting point. The system was developed using the Waterfall method, consisting of analysis, design, implementation, and testing phases. The system design is illustrated through UML diagrams such as Use Case, Activity, and Class Diagrams. With this system, the distribution of tourism information becomes more effective, and tourists can plan trips with optimized routes. Additionally, the website is expected to serve as a digital promotion medium that contributes to increasing tourist visits to Pati Regency.
Keywords: heuristic greedy; recommendation route; tourism; waterfall
Abstrak: Pariwisata di Kabupaten Pati saat ini belum memiliki sistem informasi digital yang terintegrasi, sehingga penyebaran informasi dan perencanaan perjalanan wisata masih belum optimal. Untuk mengatasi permasalahan tersebut, penelitian ini mengembangkan sebuah website pariwisata Kabupaten Pati yang dilengkapi dengan fitur rekomendasi rute wisata terbaik. Penelitian ini bertujuan untuk merancang dan membangun sistem informasi pariwisata berbasis web yang mampu menyajikan informasi destinasi wisata berdasarkan kategori, galeri media, serta video promosi YouTube. Selain itu, sistem ini dilengkapi dengan fitur unggulan bernama Patiways yang memungkinkan pengguna memilih beberapa destinasi wisata dan secara otomatis memperoleh urutan kunjungan paling efisien menggunakan algoritma heuristik greedy berdasarkan titik awal perjalanan. Pengembangan sistem dilakukan menggunakan metode Waterfall yang meliputi tahapan analisis kebutuhan, perancangan sistem, implementasi, dan pengujian. Perancangan sistem direpresentasikan menggunakan diagram UML, meliputi Use Case Diagram, Activity Diagram, dan Class Diagram. Dengan adanya sistem ini, diharapkan penyebaran informasi pariwisata menjadi lebih efektif, wisatawan dapat merencanakan perjalanan dengan rute yang optimal, serta website dapat berfungsi sebagai media promosi digital yang berkontribusi terhadap peningkatan kunjungan wisatawan ke Kabupaten Pati.
Kata kunci: heuristik greedy; pariwisata; rekomendasi rute; waterfall
Abstract:Abstract: Obesity is an escalating global health concern, with unhealthy lifestyle patterns contributing significantly to its development. This study aims to evaluate and compare three clustering techniques for categorizing…
ing lifestyle patterns and obesity-related factors: K-Means, Agglomerative Clustering, and Gaussian Mixture Model (GMM). The data used in this study is sourced from the Food Nutrition dataset, which includes variables such as dietary habits, physical activity, and socio-economic status. The three clustering methods were assessed using evaluation metrics such as Silhouette Score, Davies-Bouldin Index (DBI), and Calinski-Harabasz Index (CHI). The findings revealed that K-Means exhibited the best performance in terms of cluster separation with a Silhouette Score of 0.5559, while GMM showed better flexibility in handling more complex data. Although Agglomerative Clustering produced acceptable results, it had a higher overlap between clusters compared to the other methods. This study offers valuable insights into selecting the most appropriate clustering technique based on the data characteristics.
Keywords: agglomerative; clustering; GMM; k-means; lifestyle patterns; obesity
Abstrak: Obesitas menjadi masalah kesehatan yang semakin meningkat di seluruh dunia, dengan pola hidup yang tidak sehat berperan besar dalam perkembangannya. Penelitian ini bertujuan untuk membandingkan tiga metode clustering dalam mengelompokkan pola gaya hidup dan faktor yang memengaruhi obesitas, yaitu K-Means, Agglomerative Clustering, dan Gaussian Mixture Model (GMM). Data yang digunakan diperoleh dari dataset Food Nutrition yang mencakup informasi terkait pola makan, aktivitas fisik, serta faktor sosial-ekonomi. Ketiga metode tersebut diuji dengan menggunakan beberapa metrik evaluasi, seperti Silhouette Score, Davies-Bouldin Index (DBI), dan Calinski-Harabasz Index (CHI). Hasil penelitian menunjukkan bahwa K-Means memiliki kinerja terbaik dalam hal pemisahan klaster, dengan nilai Silhouette Score sebesar 0.5559, sementara GMM lebih fleksibel dalam menangani data yang lebih kompleks. Meskipun Agglomerative Clustering memberikan hasil yang dapat diterima, tumpang tindih antar klaster lebih besar dibandingkan dengan kedua metode lainnya. Penelitian ini memberikan pemahaman yang lebih baik mengenai pemilihan metode clustering yang tepat berdasarkan karakteristik data yang digunakan.
Kata kunci: agglomerative; clustering; GMM; k-means; obesitas; pola gaya hidup
Abstract:Abstract: The rapid growth of the digital music industry requires accurate music genre classification systems to enhance user experience in streaming services. This study compares a domain-specific Long Short-Term Memory…
(LSTM) network with three Large Language Models (LLMs)—HuBERT, WavLM, and WAV2Vec 2.0—for Music Genre Classification (MGC). The LSTM model was trained using Mel-spectrograms transformed from the GTZAN dataset, while the LLMs were fine-tuned using a smaller set of raw audio samples due to computational constraints. All models were tested on datasets with identical genre labels to ensure a fair evaluation. Results show that the LSTM model achieved the highest accuracy of 97.10%, outperforming HuBERT (86.00%), WavLM (83.00%), and WAV2Vec 2.0 (80.00%). The LSTM demonstrated superior generalization and stability without overfitting, while the LLMs struggled to differentiate between genres with similar acoustic characteristics. These findings indicate that general-purpose pre-trained models, although powerful, are less effective in music-specific tasks due to domain mismatch. Therefore, incorporating music-specific features and architectures remains essential for achieving higher accuracy and reliability in automatic genre classification systems.
Keywords: audio large language models; comparative deep learning; music genre classification.
Abstrak: Pertumbuhan industri musik digital yang pesat menuntut sistem klasifikasi genre musik yang akurat untuk meningkatkan pengalaman pengguna dalam layanan streaming. Penelitian ini dilatarbelakangi oleh perkembangan pesat model pembelajaran mendalam, khususnya jaringan LSTM dan model bahasa berskala besar LLM seperti HuBERT, WavLM, dan WAV2Vec 2.0, yang telah menunjukkan kemampuan representasi audio yang kuat. Tujuan penelitian ini ini membandingkan jaringan Long Short-Term Memory (LSTM) khusus domain dengan tiga model Large Language Models (LLM)—HuBERT, WavLM, dan WAV2Vec 2.0—untuk tugas Klasifikasi Genre Musik (MGC). Metode penelitian melibatkan pelatihan LSTM menggunakan data Mel-spectrogram hasil transformasi dari dataset GTZAN, sementara LLM disesuaikan (fine-tuning) menggunakan data audio mentah dalam jumlah lebih kecil karena keterbatasan komputasi. Seluruh model diuji pada dataset dengan label genre yang sama untuk memastikan evaluasi yang adil. Hasil penelitian menunjukkan bahwa model LSTM mencapai akurasi tertinggi sebesar 97,10%, sedangkan model HuBERT, WavLM, dan WAV2Vec 2.0 masing-masing memperoleh 86,00%, 83,00%, dan 80,00%. Model LSTM menunjukkan kemampuan generalisasi yang lebih baik tanpa overfitting, sedangkan model LLM cenderung kesulitan membedakan genre dengan karakteristik akustik yang mirip. Kesimpulan penelitian ini adalah ketidaksesuaian domain secara signifikan membatasi performa model umum saat diterapkan pada tugas berbasis musik. Oleh karena itu, penggunaan fitur dan arsitektur khusus musik sangat penting dalam membangun sistem klasifikasi genre yang lebih akurat.
Kata kunci: klasifikasi genre musik; model bahasa besar; perbandingan pembelajaran mendalam.