[1]
Harsha Sai Potluri, “NEXT-GPT: Any-to-Any Multimodal LLM for Unified Text, Image, Audio, and Video Understanding”, AS, vol. 27, no. 2, pp. 1–12, Apr. 2026.