Analisis Sentimen Multi-Bahasa Pada Media Sosial Menggunakan Hybrid Transformers Dan Contextual Embeddings

Main Article Content

Harkamsyah Andrianof
Aggy Pramana Gusman

Abstract

Analisis sentimen di media sosial telah menjadi aspek penting dalam memahami persepsi publik terhadap merek, topik, atau peristiwa tertentu. Namun, tantangan signifikan muncul ketika menganalisis konten multibahasa yang mencerminkan keragaman pengguna global. Penelitian ini mengusulkan pendekatan hibrida yang mengintegrasikan Transformer dan Contextual Embeddings untuk meningkatkan akurasi analisis sentimen lintas bahasa. Metode ini menggabungkan kekuatan Transformer dalam menangkap konteks semantik yang mendalam dengan Contextual Embeddings yang mampu merepresentasikan nuansa linguistik spesifik untuk setiap bahasa. Dataset penelitian mencakup komentar dari berbagai platform media sosial dalam lima bahasa: Indonesia, Inggris, Mandarin, Spanyol, dan Arab. Hasil eksperimen menunjukkan bahwa pendekatan hibrida ini mencapai akurasi 94,2% dan skor F1 sebesar 0,932, melampaui model BERT mandiri sebagai dasar, yang hanya mencapai 89,5%. Temuan ini menegaskan efektivitas pengintegrasian beberapa embedding dalam mengatasi keunikan setiap bahasa. Penelitian ini berkontribusi pada pengembangan sistem analisis sentimen yang lebih kuat dan adaptif terhadap keragaman linguistik dalam ekosistem media sosial global.

Article Details

Section
Articles

References

T. Mikolov, I. Sutskever, K. Chen, G. Corrado, dan J. Dean, "Representasi terdistribusi dari kata dan frasa dan komposisionalitasnya," dalam Prosiding Konferensi ke-27 tentang Sistem Pemrosesan Informasi Neural (NeurIPS), 2013, hlm. 3111–3119.

J. Pennington, R. Socher, dan C. D. Manning, "GloVe: Vektor global untuk representasi kata," dalam Prosiding Konferensi Metode Empiris dalam Pemrosesan Bahasa Alami (EMNLP), 2014, hlm. 1532–1543.

M. E. Peters, M. Neumann, M. Iyyer, M. Gardner, C. Clark, K. Lee, dan L. Zettlemoyer, "Representasi kata kontekstual mendalam," dalam Prosiding Konferensi Asosiasi Bab Amerika Utara Linguistik Komputasi: Teknologi Bahasa Manusia (NAACL-HLT), 2018, hlm. 2227–2237.

A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, Ł. Kaiser, dan I. Polosukhin, "Perhatian . . . . . . . " Konferensi ke-31. Informasi Saraf. Proses. sistem. (NeurIPS), 2017, hlm.1-11. 5998–6008.

J. Devlin, M.-W. Chang, K. Lee, dan K. Toutanova, "BERT: Pra-pelatihan transformer bidirectional mendalam untuk pemahaman bahasa," dalam Prosiding Konferensi Asosiasi Bab Amerika Utara Linguistik Komputasi: Teknologi Bahasa Manusia (NAACL-HLT), 2019, hlm. 4171–4186.

A. Conneau, K. Khandelwal, N. Goyal, V. Chaudhary, G. Wenzek, F. Guzmán, E. Grave, M. Ott, L. Zettlemoyer, dan V. Stoyanov, "Pembelajaran representasi lintas bahasa tanpa pengawasan dalam skala besar," dalam Prosiding Pertemuan Tahunan ke-58 Asosiasi Linguistik Komputasi (ACL), 2020, hlm. 8440–8451.

E. M. Mercha dan H. Benbrahim, "Pembelajaran mesin dan pembelajaran mendalam untuk analisis sentimen lintas bahasa: Sebuah survei," Neurocomputing, vol. 531, hlm. 195–216, 2023.

M. Wankhade, A. C. S. Rao, dan C. Kulkarni, "Sebuah survei tentang metode, aplikasi, dan tantangan analisis sentimen," Artificial Intelligence Review, vol. 55, no. 7, hlm. 5731–5780, 2022.

M. K. Nazir, C. N. Faisal, M. A. Habib, dan H. Ahmad, "Memanfaatkan transformer multibahasa untuk analisis sentimen multikelas dalam data campuran kode bahasa-bahasa dengan sumber daya terbatas," IEEE Access, vol. 13, hlm. 7538–7554, 2025.

S. Sitaram, K. R. Chandu, S. K. Rallabandi, dan A. W. Black, "Sebuah survei tentang pemrosesan ucapan dan bahasa peralihan kode," arXiv preprint arXiv:1904.00784, 2019.

E. W. Pamungkas, A. Fatmawati, Y. S. Nugroho, D. Gunawan, dan E. Sudarmilah, “Deteksi ujaran kebencian di media sosial campuran kode Indonesia: Memanfaatkan sumber daya bahasa multibahasa,” dalam Proc. ke-7 Int. Konf. Informatika dan Komputasi (ICIC), 2022, hlm.1–5.

M. M. Rahman, A. I. Shiplu, Y. Watanobe, dan M. A. Alam, "RoBERTa-BiLSTM: Model hibrida sadar konteks untuk analisis sentimen," IEEE Trans. Emerging Topics in Computational Intelligence, 2025, doi: 10.1109/TETCI.2025.3572150.

F. Barbieri, L. Espinosa Anke, dan J. Camacho-Collados, "XLM-T: Model bahasa multibahasa di Twitter untuk analisis sentimen dan seterusnya," dalam Prosiding Konferensi Sumber Daya dan Evaluasi Bahasa ke-13 (LREC), 2022, hlm. 258–266.

F. Koto, A. Rahimi, J. H. Lau, dan T. Baldwin, "IndoLEM dan IndoBERT: Kumpulan data benchmark dan model bahasa pra-terlatih untuk NLP Indonesia," dalam Prosiding Konferensi Linguistik Komputasional Internasional ke-28 (COLING), 2020, hlm. 757–770.

F. Koto, J. H. Lau, dan T. Baldwin, "IndoBERTweet: Model bahasa pra-terlatih untuk Twitter Indonesia dengan inisialisasi kosakata spesifik domain yang efektif," dalam Prosiding Konferensi Metode Empiris dalam Pemrosesan Bahasa Alami (EMNLP), 2021, hlm. 10660–10668.

V. Barriere dan A. Balahur, "Meningkatkan analisis sentimen pada tweet non-Inggris menggunakan transformer multibahasa dan terjemahan otomatis untuk augmentasi data," arXiv preprint arXiv:2010.03486, 2020.

A. Joshi, P. Bhattacharyya, dan M. J. Carman, "Deteksi sarkasme otomatis: Sebuah survei," ACM Computing Surveys, vol. 50, no. 5, Art. 73, 2017.

J. L. Fleiss, "Mengukur kesepakatan skala nominal di antara banyak penilai," Buletin Psikologi, vol. 76, no. 5, hlm. 378–382, 1971.

S. Hochreiter dan J. Schmidhuber, "Memori jangka pendek panjang," Komputasi Neural, vol. 9, no. 8, hlm. 1735–1780, 1997.

M. Schuster dan K. K. Paliwal, "Jaringan saraf berulang dua arah," IEEE Trans. Signal Processing, vol. 45, no. 11, hlm. 2673–2681, 1997.

D. Bahdanau, K. Cho, dan Y. Bengio, "Terjemahan mesin saraf dengan pembelajaran bersama untuk menyelaraskan dan menerjemahkan," dalam Prosiding Konferensi Internasional ke-3 tentang Pembelajaran Representasi (ICLR), 2015.

N. Srivastava, G. Hinton, A. Krizhevsky, I. Sutskever, dan R. Salakhutdinov, "Dropout: Cara sederhana untuk mencegah jaringan saraf dari overfitting," Journal of Machine Learning Research, vol. 15, no. 1, hlm. 1929–1958, 2014.

T. Wolf, L. Debut, V. Sanh, J. Chaumond, C. Delangue, A. Moi, P. Cistac, T. Rault, R. Louf, M. Funtowicz, J. Davison, S. Shleifer, P. von Platen, C. Ma, Y. Jernite, J. Plu, C. Xu, T. Le Scao, S. Gugger, M. Drame, Q. Lhoest, dan A. M. Rush, "Transformers: Pemrosesan bahasa alami terkini," dalam Prosiding Konferensi Metode Empiris dalam Pemrosesan Bahasa Alami: Demonstrasi Sistem (EMNLP), 2020, hlm. 38–45.

I. Loshchilov dan F. Hutter, "Regularisasi peluruhan bobot yang terpisah," dalam Prosiding Konferensi Internasional ke-7 tentang Pembelajaran Representasi (ICLR), 2019.

B. Gambäck dan A. Das, "Membandingkan tingkat peralihan kode dalam korpus," dalam Prosiding Konferensi Internasional ke-10 tentang Sumber Daya Bahasa dan Evaluasi (LREC), 2016, hlm. 1850–1855.

F. Wilcoxon, "Perbandingan individu dengan metode pemeringkatan," Buletin Biometrik, vol. 1, no. 6, hlm. 80–83, 1945.

J. Devlin, M. W. Chang, K. Lee, and K. Toutanova, "BERT: Pre-training of deep bidirectional transformers for language understanding," in Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Minneapolis, MN, USA, 2019, pp. 4171–4186.

A. Conneau, K. Khandelwal, N. Goyal, V. Chaudhary, G. Wenzek, F. Guzmán, É. Grave, M. Auli, A. Joulin, and T. Grave, "Unsupervised cross-lingual representation learning at scale," in Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics (ACL), Online, 2020, pp. 8440–8451.

J. Pennington, R. Socher, and C. D. Manning, "GloVe: Global vectors for word representation," in Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), Doha, Qatar, 2014, pp. 1532–1543.

Y. Kim, "Convolutional neural networks for sentence classification," in Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), Doha, Qatar, 2014, pp. 1746–1751.

S. Hochreiter and J. Schmidhuber, "Long short-term memory," Neural Computation, vol. 9, no. 8, pp. 1735–1780, Nov. 1997.

A. Vaswani, N. Shazeer, P. N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, Ł. Kaiser, and I. Polosukhin, "Attention is all you need," in Advances in Neural Information Processing Systems (NeurIPS), Long Beach, CA, USA, 2017, pp. 5998–6008.

M. E. Peters, M. Neumann, M. Iyyer, M. Gardner, C. Clark, K. Lee, and L. Zettlemoyer, "Deep contextualized word representations," in Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), New Orleans, LA, USA, 2018, pp. 2227–2237.

P. Bojanowski, E. Grave, A. Joulin, and T. Mikolov, "Enriching word vectors with subword information," Transactions of the Association for Computational Linguistics (TACL), vol. 5, pp. 135–146, 2017.

Z. Yang, Z. Dai, Y. Yang, J. Carbonell, R. Salakhutdinov, and Q. V. Le, "XLNet: Generalized autoregressive pretraining for language understanding," in Advances in Neural Information Processing Systems (NeurIPS), Vancouver, Canada, 2019, pp. 5753–5763.

A. Z. Lim, A. Pesaranghader, and G. W. S. Hsu, "Multilingual and multi-aspect sentiment analysis with context-aware self-attention," in Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP), Online, 2020, pp. 6814–6823.

C. Xing, Y. Wang, J. Liu, Y. Huang, and W. Y. Wang, "Hierarchical attention networks for document classification," in Proceedings of the 2016 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), San Diego, CA, USA, 2016, pp. 1480–1489.

L. Yao, C. Mao, and Y. Luo, "Graph convolutional networks for text classification," Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, no. 01, pp. 7370–7377, Jul. 2019.

Y. Li and T. Yang, "Word embedding and text classification research in big data era," Journal of Electrical and Computer Engineering, vol. 2016, p. 7285079, 2016.

B. Pang and L. Lee, "Opinion mining and sentiment analysis," Foundations and Trends in Information Retrieval, vol. 2, nos. 1–2, pp. 1–135, 2008.

S. Rosenthal, N. Farra, and P. Nakov, "SemEval-2017 task 4: Sentiment analysis in Twitter," in Proceedings of the 11th International Workshop on Semantic Evaluation (SemEval-2017), Vancouver, Canada, 2017, pp. 502–518.

T. Chen, R. Kornblith, M. Norouzi, and G. Hinton, "A simple framework for contrastive learning of visual representations," in Proceedings of the 37th International Conference on Machine Learning (ICML), Online, 2020, pp. 1597–1607.

X. Zhang, J. Zhao, and Y. LeCun, "Character-level convolutional networks for text classification," in Advances in Neural Information Processing Systems (NeurIPS), Montreal, Canada, 2015, pp. 649–657.

F. Liu, J. G. Eisner, and D. Ruths, "Fast and accurate deep network learning by exponential linear units (ELUs)," in Proceedings of the 2016 International Conference on Learning Representations (ICLR), San Juan, Puerto Rico, 2016, pp. 1–13.

D. P. Kingma and J. Ba, "Adam: A method for stochastic optimization," in Proceedings of the 2015 International Conference on Learning Representations (ICLR), San Diego, CA, USA, 2015, pp. 1–15.

L. Yao, G. Huang, M. Liu, L. Deng, and X. Maybank, "Deep learning from crowds with belief propagation," in Proceedings of the 2021 IEEE/CVF International Conference on Computer Vision (ICCV), Montreal, Canada, 2021, pp. 4701–4710.

Y. Bengio, A. Courville, and P. Vincent, "Representation learning: A review and new perspectives," IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), vol. 35, no. 8, pp. 1798–1828, Aug. 2013.

R. Socher, A. Perelygin, J. Wu, J. Chuang, C. D. Manning, A. Y. Ng, and C. Potts, "Recursive deep models for semantic compositionality over a sentiment treebank," in Proceedings of the 2013 Conference on Empirical Methods in Natural Language Processing (EMNLP), Seattle, WA, USA, 2013, pp. 1631–1642.

J. Turian, L. Ratinov, and Y. Bengio, "Word representations: A simple and general method for semi-supervised learning," in Proceedings of the 48th Annual Meeting of the Association for Computational Linguistics (ACL), Uppsala, Sweden, 2010, pp. 384–394.

S. Wang and C. D. Manning, "Baselines and bigrams: Simple, good sentiment and topic classification," in Proceedings of the 50th Annual Meeting of the Association for Computational Linguistics (ACL), Jeju Island, Korea, 2012, pp. 90–94.

N. Kalchbrenner, E. Grefenstette, and P. Blunsom, "A convolutional neural network for modelling sentences," in Proceedings of the 52nd Annual Meeting of the Association for Computational Linguistics (ACL), Baltimore, MD, USA, 2014, pp. 655–665.

Most read articles by the same author(s)