구글 젬마4 스마트폰에서 로컬 실행 가능

안녕하세요, 리키입니다. 오늘은 구글에서 발표한 젬마 4(Gemma 4) 모델과 관련된 기술적인 소식에 대해 이야기해 보려고 합니다. 쉽게 말해서, 이제 우리가 사용하는 스마트폰이나 일반 소비자용 그래픽 처리 장치(GPU)에서도 이 강력한 인공지능을 직접 실행할 수 있게 되었다는 내용입니다.

구글이 젬마 4 모델을 소비자 기기에서 직접 구동할 수 있도록 압축하는 QAT 체크포인트를 공개했습니다. 특히 E2B 모델의 경우 메모리 사용량이 1기가바이트(GB) 미만으로 줄어들었다고 하더군요. 이렇게 메모리를 크게 절감했기 때문에 스마트폰이나 일반 소비자용 GPU에서도 이 모델을 로컬에서 실행하는 것이 현실화되었다는 점이 중요합니다.

그렇다면 어떻게 이런 압축과 품질 유지가 가능했을까요? 여기서 핵심은 QAT(양자화 인식 훈련)라는 기술입니다. QAT는 모델을 훈련하는 과정에서 양자화를 함께 시뮬레이션하여 압축하고, 그 후 성능 저하를 최소화하는 방식입니다. 단순히 훈련이 끝난 후에 압축하는 표준 PTQ와 달리, 이 방법은 품질 손실을 훈련 단계에서 미리 보정하기 때문에 동일한 압축률에서도 더 높은 출력 품질을 유지할 수 있다는 장점이 있습니다.

구글은 이러한 기술을 활용하여 젬마 4를 범용 Q4_0 포맷으로 제공했습니다. 이는 모델의 크기를 줄이면서도 중요한 성능과 품질을 최대한 보존하려는 노력이 담겨 있다고 볼 수 있겠습니다. 결국, 복잡한 인공지능 기술이 더 많은 사람들의 손에 들어와서 일상생활에서 활용될 수 있는 환경이 마련되었다는 점을 의미합니다.


참고 원문: https://www.digitalfocus.news/news/articleView.html?idxno=21361

댓글 달기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다

위로 스크롤