Harsha Sai Potluri. (2026). NEXT-GPT: Any-to-Any Multimodal LLM for Unified Text, Image, Audio, and Video Understanding. Acta Scientiae, 27(2), 1–12. https://doi.org/10.22178/acta.27.2.1