안녕하세요, 리키입니다. 오늘은 구글에서 새로 내놓은 인공지능 모델에 대한 이야기를 좀 해보려고 합니다. 요즘 기술이 참 빠르게 발전해서 우리가 일상생활에서 접하는 방식도 많이 바뀌고 있더군요.
구글이 이번에 ‘Gemma 4 12B’라는 새로운 모델을 발표했습니다. 이 모델의 가장 큰 특징은 멀티모달(multimodal) 기능을 갖추면서도 기존 방식과 달리 인코더가 없는 아키텍처를 사용한다는 점입니다. 복잡한 이미지나 오디오 정보를 처리할 때 여러 단계를 거치던 방식을 없애서, 데이터를 훨씬 빠르게 처리하고 지연 시간을 줄일 수 있게 되었다는 것이죠.
특히 이 모델은 여러분의 노트북에서 직접 실행될 수 있도록 설계되었다는 점이 중요합니다. 기존의 멀티모달 시스템들은 시각이나 오디오를 따로 인코딩하는 복잡한 과정을 거쳤는데, 이번 Gemma 4 12B는 이러한 부담을 줄였습니다. 덕분에 16GB VRAM이나 통합 메모리가 있는 노트북에서도 비교적 쉽게 구동이 가능해졌습니다. 이는 AI 기술이 더 이상 거대한 서버에만 머물지 않고 우리 손안으로 들어올 수 있다는 의미입니다.
더 놀라운 점은 이 모델이 오디오 입력을 기본적으로 지원한다는 것입니다. 이전에는 음성 처리 기능이 작은 모델들(예: E4B)로 제한적이었지만, Gemma 4 12B는 더 포괄적인 이해 능력을 갖추게 되었습니다. 단순히 글만 읽는 것이 아니라 소리나 영상을 함께 이해하는 데 강점을 보인다는 이야기입니다.
개발자들을 위해서도 좋은 소식이 있습니다. 구글은 이번에 개발자들이 로컬 환경에서 실시간으로 음성이나 시각 입력과 상호작용할 수 있도록 다운로드 가능한 macOS 데스크톱 애플리케이션까지 제공하고 있습니다. 이는 일반 사용자들도 쉽게 최신 멀티모달 AI를 경험해 볼 수 있는 기회가 될 것 같습니다.


