Harsha Sai Potluri (2026) “NEXT-GPT: Any-to-Any Multimodal LLM for Unified Text, Image, Audio, and Video Understanding”, Acta Scientiae, 27(2), pp. 1–12. doi: 10.22178/acta.27.2.1.