안녕하세요, 리키입니다. 오늘은 구글에서 발표한 젬마 4(Gemma 4) 모델과 관련된 기술적인 소식에 대해 이야기해 보려고 합니다. 쉽게 말해서, 이제 우리가 사용하는 스마트폰이나 일반 소비자용 그래픽 처리 장치(GPU)에서도 이 강력한 인공지능을 직접 실행할 수 있게 되었다는 내용입니다.
구글이 젬마 4 모델을 소비자 기기에서 직접 구동할 수 있도록 압축하는 QAT 체크포인트를 공개했습니다. 특히 E2B 모델의 경우 메모리 사용량이 1기가바이트(GB) 미만으로 줄어들었다고 하더군요. 이렇게 메모리를 크게 절감했기 때문에 스마트폰이나 일반 소비자용 GPU에서도 이 모델을 로컬에서 실행하는 것이 현실화되었다는 점이 중요합니다.
그렇다면 어떻게 이런 압축과 품질 유지가 가능했을까요? 여기서 핵심은 QAT(양자화 인식 훈련)라는 기술입니다. QAT는 모델을 훈련하는 과정에서 양자화를 함께 시뮬레이션하여 압축하고, 그 후 성능 저하를 최소화하는 방식입니다. 단순히 훈련이 끝난 후에 압축하는 표준 PTQ와 달리, 이 방법은 품질 손실을 훈련 단계에서 미리 보정하기 때문에 동일한 압축률에서도 더 높은 출력 품질을 유지할 수 있다는 장점이 있습니다.
구글은 이러한 기술을 활용하여 젬마 4를 범용 Q4_0 포맷으로 제공했습니다. 이는 모델의 크기를 줄이면서도 중요한 성능과 품질을 최대한 보존하려는 노력이 담겨 있다고 볼 수 있겠습니다. 결국, 복잡한 인공지능 기술이 더 많은 사람들의 손에 들어와서 일상생활에서 활용될 수 있는 환경이 마련되었다는 점을 의미합니다.
참고 원문: https://www.digitalfocus.news/news/articleView.html?idxno=21361