Harsha Sai Potluri. “NEXT-GPT: Any-to-Any Multimodal LLM for Unified Text, Image, Audio, and Video Understanding”. Acta Scientiae, vol. 27, no. 2, Apr. 2026, pp. 1-12, doi:10.22178/acta.27.2.1.