RTX Spark 메모리 128GB, 내 PC에서 AI를 돌리면 뭐가 다를까?
RTX Spark의 최대 128GB 공유 메모리는 그래픽카드 전용 메모리와 다릅니다. AI 모델을 담는 용량 계산부터 응답 속도, 문서 처리와 온라인 서비스의 차이까지 풀어봅니다.
RTX Spark의 최대 128GB는 큰 AI 모델을 PC 안에 올려놓을 여유입니다. 모든 AI가 빨라진다는 약속도, GPU 혼자 쓰는 128GB도 아닙니다. NVIDIA는 CPU와 GPU가 함께 쓰는 메모리 구성을 안내합니다. 브라우저와 편집 앱을 열어둔 채 AI까지 실행하면 같은 공간을 나눠 쓰므로 표기 용량을 모델 파일로 끝까지 채울 수는 없습니다.
온라인 AI와 로컬 AI
웹에서 질문을 보내는 AI 서비스는 대개 서비스 운영사의 서버에서 답을 계산합니다. 로컬 AI는 실행 프로그램과 모델을 자기 PC에 두고 계산하는 방식입니다. 인터넷으로 긴 문서를 올리기 꺼려지거나 연결이 끊긴 장소에서 준비한 모델을 쓰려는 상황에 의미가 있습니다. 모델 다운로드와 설치까지 인터넷 없이 된다는 뜻은 아닙니다.
예를 들어 출장지에서 준비해 간 제품 매뉴얼을 검색하는 작업을 생각해볼 수 있습니다. 문서를 읽어 답할 모델과 실행 환경이 PC에 준비돼 있어야 합니다. 파일을 폴더에 복사했다고 바로 검색 서비스가 완성되지는 않습니다. 글자가 이미지로 들어 있는 PDF라면 글자를 읽는 과정도 필요하고 찾은 내용을 답과 연결하는 프로그램도 있어야 합니다.

7B와 32B를 용량으로 바꿔보면
모델 이름 뒤의 B는 보통 매개변수 수를 십억 단위로 나타냅니다. 매개변수는 학습 결과를 담는 숫자입니다. 이 숫자를 더 적은 비트로 저장해 메모리 부담을 줄이는 방법을 양자화라고 합니다. Hugging Face의 설명처럼 저장 정밀도를 낮추는 접근이며 용량을 줄였을 때의 품질과 실행 지원도 함께 봐야 합니다.
숫자 하나를 4비트로 담는다고 단순화하면 8비트가 1바이트이므로 매개변수 하나당 0.5바이트입니다. 아래는 순수하게 가중치 숫자를 담는 양만 계산한 예시입니다. 실제 배포 파일이나 실행에 필요한 전체 메모리를 예측하는 표는 아닙니다.
| 가정한 모델 | 단순 계산 | 가중치만의 크기 |
|---|---|---|
| 7B, 4비트 | 70억 × 0.5바이트 | 약 3.5GB |
| 32B, 4비트 | 320억 × 0.5바이트 | 약 16GB |
여기서 GB는 10억 바이트로 계산했습니다. 실행할 때는 운영체제, 실행 프로그램, 양자화에 필요한 부가 정보, 대화 내용을 처리하며 남기는 중간 데이터가 더해집니다. 그래서 16GB라는 계산만 보고 메모리 16GB PC에서 같은 모델을 여유 있게 돌린다고 결론 내리면 안 됩니다.
긴 문서를 넣었을 때의 메모리
한 줄 질문과 수십 쪽의 문서를 함께 넣는 질문은 작업량이 다릅니다. 모델 파일이 한 번 열렸다고 긴 문서도 같은 조건에서 처리한다고 말하기는 어렵습니다. 질문과 이전 대화를 유지하는 길이에 따라서도 메모리 사용량이 달라집니다.
실제 시험에서는 모델 이름과 저장 형식, 입력 길이, 동시에 실행한 앱을 같이 기록하는 편이 좋습니다. ‘잘 돌아간다’는 말만 듣고 자신의 작업에 대입하기는 어렵습니다. 짧은 영어 질문의 결과만 보고 긴 한국어 보고서 정리까지 같은 속도일 것으로 기대할 수도 없습니다.
128GB라는 글자보다 선택한 구성
현재 공식 사양표에는 노트북 구성이 최대 128GB와 최대 64GB로 나뉩니다. RTX Spark라는 이름이 같아도 전부 128GB 제품은 아닙니다. 최대치는 구매한 기기의 실제 용량과도 다르므로 국내 판매 모델의 구성표가 필요합니다.
메모리는 모델을 담을 수 있는지를 가르는 조건이고 응답 속도는 연산 성능, 메모리에서 데이터를 읽는 속도, 실행 프로그램의 지원에도 영향을 받습니다. 큰 모델을 열 수 있다는 것과 기다릴 만한 시간 안에 답이 나오는 것은 다른 질문입니다. 출시 전인 지금은 직접 측정한 초당 응답량을 제시할 수 없습니다.
내 PC에서 돌리면 문서가 밖으로 안 나갈까
모델 계산을 로컬에서 해도 사용하는 앱이 웹 검색이나 외부 API를 호출하면 일부 데이터는 밖으로 나갈 수 있습니다. API는 프로그램이 다른 서비스에 작업을 요청하는 통로입니다. ‘로컬’ 표시 하나로 문서가 어디에도 전송되지 않는다고 보증할 수는 없습니다. 민감한 파일을 쓰기 전에는 실제 앱의 외부 연결과 전송 설정을 확인해야 합니다.
처음에는 공개 문서로 필요한 기능을 시험하는 편이 좋습니다. 답변에 원문 위치가 붙는지, 없는 내용을 그럴듯하게 덧붙이지 않는지, 인터넷을 끊어도 필요한 단계가 동작하는지 보면 됩니다. 큰 메모리가 잘못된 답을 자동으로 막아주지는 않습니다.
온라인 AI에 가끔 질문하는 용도라면 128GB를 먼저 목표로 잡을 이유가 약합니다. 이미 돌릴 모델과 처리할 문서가 있고 현재 PC의 용량이 막힌다면 이야기가 달라집니다. 그 작업을 들고 다닐지 책상에 둘지는 RTX Spark 노트북과 소형 데스크톱 비교에서 이어집니다.