안녕하세요, 리키입니다. 요즘 인공지능 분야에서 구글이 아주 흥미로운 실험 결과를 내놓았더군요. 오늘은 그 ‘디퓨전젬마’라는 모델에 대해 제가 들은 내용을 여러분과 함께 이야기해 보려고 합니다.
구글이 텍스트를 만드는 속도를 최대 4배까지 빠르게 만들었다는 실험용 모델을 공개했습니다. 기존의 방식처럼 글자 하나씩 차례로 만들어내는 대신, 여러 글자를 한꺼번에 생성하는 새로운 방식을 사용한 것이죠. 이 모델은 토큰 하나씩 이어 붙이는 ‘타자기’ 방식에서 벗어나, 마치 인쇄기처럼 256개의 토큰을 동시에 만들어낸다고 설명합니다. 이는 AI가 글 전체를 한 번에 처리하여 속도를 높인 결과입니다.
이 모델의 핵심은 ‘확산(Diffusion)’이라는 기법을 적용했다는 점입니다. 이미지 생성 AI에서 흐릿한 잡음에서 시작해 그림을 다듬어 완성하는 방식과 비슷하게, 디퓨전젬마는 의미 없는 토큰으로 시작해서 여러 번 검토하며 글 전체를 스스로 고쳐나가는 과정을 거칩니다. 이렇게 모든 글자를 한눈에 보면서 오류를 실시간으로 수정할 수 있는 능력을 갖추게 되었습니다. 덕분에 복잡한 마크다운 서식이나 코드를 다룰 때도 훨씬 유리하다고 구글은 설명하고 있습니다.
소비자용 GPU에서도 가능한 효율적인 구조
이 모델은 260억 개의 매개변수를 가진 ‘전문가 혼합(MoE)’ 구조로 되어 있습니다. 전문가 혼합이란 여러 전문가 모듈 중 입력에 따라 필요한 부분만 골라 쓰는 방식인데, 디퓨전젬마는 전체 중에서 실제 작동 시에는 38억 개의 매개변수만 활성화합니다. 이 덕분에 모델의 크기를 줄이는 양자화 기법을 적용하면, 비싼 장비가 아니더라도 소비자용 그래픽카드에서도 충분히 구동할 수 있게 되었다고 합니다.
구글은 엔비디아(NVIDIA)와 협력하여 지포스(GeForce) RTX 5090 같은 소비자용 장비에 최적화했습니다. 특히 계산 부담을 줄이면서도 속도를 높이는 ‘NVFP4’ 방식을 기본으로 지원했더군요. 이렇게 하면 소비자들이 집에서 사용하는 GPU에서도 초당 수백 개의 토큰을 빠르게 생성해낼 수 있게 된 것입니다.
물론 이 모델은 속도를 얻는 대신 품질이나 범용성은 조금 양보한 실험적인 결과이기도 합니다. 구글은 빠른 병렬 생성에 중점을 둔 만큼, 최고 수준의 품질이 필요한 작업에는 기존의 모델을 사용하라고 권했습니다. 하지만 이는 당장 모든 것을 대체하기보다는, 연구자와 개발자들이 텍스트 생성 방식을 새롭게 시험해 볼 수 있는 개방된 무대를 제공한다는 점에서 큰 의미가 있다고 생각합니다.
참고 원문: https://kitpa.org/news/1637