오늘의 브리핑종목ETF비교내 포트폴리오MBTI 테스트딥 리서치대가의 인사이트AI 리터러시

온디바이스 AI — 내 기기에서 도는 AI는 무엇이 다른가

홈 › AI 리터러시 › 온디바이스 AI — 내 기기에서 도는 AI는 무엇이 다른가
🧠 AI기초

온디바이스 AI — 내 기기에서 도는 AI는 무엇이 다른가

서버 왕복 없이 내 기기 안에서 끝나는 AI. 양자화로 모델을 압축하고 NPU로 배터리를 아끼는 원리, 그리고 지금 뭐가 되고 뭐가 안 되는지.

·2026-08-29·약 12분
서버 없이 돈다는 것
기기 안에서 완결
인터넷 끊겨도, 요청을 보내지 않아도 동작
70억 파라미터 모델
14GB → 4GB
양자화로 3.5배 압축, 스마트폰 램에 들어감
CPU 대비 NPU 효율
수십 배
같은 연산을 훨씬 적은 배터리로
"온디바이스 AI" 문구
경계가 흐릿함
일부만 기기에서 돌고 나머지는 서버로 가는 경우 많음

온디바이스 AI
내 기기에서 도는 AI는 무엇이 다른가

📌 이 글의 핵심 3줄 요약
① 온디바이스 AI는 내 스마트폰·PC 안에서 요청부터 응답까지 전부 끝나는 방식이다. 인터넷이 없어도, 회사 서버에 아무것도 보내지 않아도 동작한다.
② 문제는 크기다. 서버급 모델을 기기에 그대로 넣을 수 없어서, 양자화로 모델을 압축하고 NPU라는 전용 칩으로 배터리를 아낀다.
③ "온디바이스 AI"라는 문구를 볼 때 한 가지를 확인해야 한다 — 정말 전부 기기에서 도는지, 아니면 일부만 그렇고 나머지는 여전히 서버로 가는지.

① 온디바이스 AI란 정확히 무엇인가

지금까지 이 시리즈에서 다룬 AI는 전부 서버에서 돈다. 질문을 입력하면 그 내용이 인터넷을 거쳐 회사의 대형 서버로 전송되고, 서버가 계산을 마친 뒤 결과를 다시 내 화면으로 보낸다. 토큰과 컨텍스트 윈도우에서 다룬 "그릇" 비유도 이 서버 왕복을 전제로 한 이야기였다.

온디바이스 AI는 이 왕복을 없앤다. 모델 자체가 스마트폰·노트북 안에 통째로 들어와 있고, 질문을 입력하는 순간부터 답이 나올 때까지 전부 그 기기 안에서 끝난다. 인터넷에 한 바이트도 나가지 않는다.

서버 AI (지금까지 다룬 것)온디바이스 AI
모델이 있는 곳회사의 대형 서버내 기기 안
인터넷 필요 여부필수불필요
요청 데이터서버로 전송됨기기 밖으로 안 나감
모델 크기수천억 파라미터도 가능기기 메모리에 맞는 크기로 제한

스마트폰의 사진 앱이 오프라인에서도 얼굴을 인식하거나, 키보드가 인터넷 없이 다음 단어를 예측하는 것이 이런 방식이다. LLM 작동 원리에서 본 대로 모델은 결국 숫자로 된 파라미터 덩어리인데, 그 덩어리를 서버가 아니라 내 손 안의 기기가 직접 들고 계산한다.

② 왜 굳이 서버로 안 보내고 기기에서 돌리나

서버가 훨씬 강력한데 왜 성능을 포기하면서까지 기기에서 돌릴까. 이유는 네 가지로 나뉜다.

이유내용
지연시간서버 왕복에는 항상 네트워크 시간이 붙는다. 기기 안에서 끝나면 그 시간이 없어 실시간 반응이 가능하다.
오프라인 동작비행기·지하·산간처럼 인터넷이 안 되는 상황에서도 기능이 죽지 않는다.
프라이버시사진·메시지·위치 같은 민감한 데이터가 애초에 기기 밖으로 나가지 않는다.
비용서버 연산은 요청마다 회사가 전기·GPU 비용을 지불한다. 기기에서 돌면 그 비용이 사용자의 배터리로 옮겨간다.

이 중 프라이버시는 특히 민감한 데이터를 다룰수록 값어치가 커진다. 다만 이 글은 "온디바이스면 무조건 안전하다"는 단순화는 하지 않는다. 기기 안에서 도는 부분과, 여전히 서버로 나가는 부분이 앱마다 다르기 때문이다. 서버로 가는 AI를 쓸 때 무엇을 확인해야 하는지는 AI와 개인정보에서 별도로 다룬다.

③ 문제는 크기 — 왜 그냥 욱여넣을 수 없나

서버에서 도는 대형 모델을 스마트폰에 그대로 복사해 넣으면 될 것 같지만, 그럴 수 없다. 모델은 숫자(파라미터)의 나열이고, 그 숫자 하나하나가 저장공간을 차지한다.

일반적인 방식(FP16, 숫자 하나당 16비트)으로 파라미터를 저장하면, 70억 개 파라미터를 가진 비교적 작은 모델도 약 14GB가 된다. 최신 스마트폰의 램(RAM)이 보통 8~12GB인 걸 감안하면, 모델 하나 불러오는 것만으로 기기가 다른 작업을 할 공간이 없어진다.

⚠️ 크기만 문제가 아니다 — 배터리
설령 모델이 메모리에 들어간다 해도, 그 연산을 일반 CPU로 돌리면 배터리가 순식간에 닳는다. 서버는 전용 냉각 시설과 대규모 전력을 쓸 수 있지만 스마트폰은 손바닥 안의 배터리 하나로 버텨야 한다. 그래서 크기를 줄이는 기술(양자화)과 연산을 효율화하는 전용 칩(NPU)이 둘 다 필요하다.

④ 양자화 — 정밀도를 낮춰 몸집을 줄이는 기법

양자화는 각 파라미터를 표현하는 데 쓰는 비트 수를 줄이는 기법이다. 원리는 사진 파일을 저장할 때 화질을 낮춰 용량을 줄이는 것과 비슷하다 — 정보를 조금 덜 정밀하게 저장하는 대신 용량을 크게 줄인다.

정밀도파라미터당 비트70억 파라미터 모델 크기비고
FP16 (원본)16비트약 14GB서버에서 흔히 쓰는 기본 정밀도
INT88비트약 7GB절반으로 압축
INT44비트약 3.5~4GB스마트폰 램에 무리 없이 들어감

같은 모델이 16비트에서 4비트로 내려가면 크기가 약 4분의 1이 된다. 14GB짜리 모델이 4GB 안팎으로 줄어들면서, 다른 앱을 위한 메모리를 남겨두고도 기기에 탑재할 수 있게 된다.

💡 공짜는 아니다 — 정밀도와 품질의 거래
숫자를 더 거칠게 저장하면 미묘한 계산 오차가 쌓인다. 그래서 양자화된 모델은 원본보다 답변 품질이 약간 떨어질 수 있다. 다만 최근 양자화 기법들은 이 손실을 상당히 줄여서, 일상적인 대화나 짧은 요약 같은 작업에서는 차이를 체감하기 어려운 수준까지 왔다. 복잡한 추론이나 정밀한 숫자 계산이 필요한 작업일수록 이 손실이 더 드러난다.

⑤ NPU — 왜 CPU·GPU로는 부족한가

모델을 기기에 넣는 데 성공해도, 그걸 돌릴 연산 장치가 비효율적이면 배터리가 금방 닳는다. 그래서 최근 스마트폰·노트북에는 NPU(Neural Processing Unit, 신경망 처리 장치)라는 전용 칩이 따로 들어간다.

CPU는 온갖 종류의 계산을 순서대로 처리하도록 설계된 범용 장치다. GPU는 그래픽 연산처럼 같은 계산을 대량으로 병렬 처리하는 데 강하다. NPU는 여기서 한 단계 더 나아가, AI 모델이 실제로 하는 연산(행렬 곱셈 같은 것)만 아주 효율적으로 처리하도록 회로 자체를 그 용도에 맞춰 설계한 칩이다.

연산 장치설계 목적AI 연산 효율
CPU범용 계산 (순차 처리)낮음 — 다목적이라 특화되지 않음
GPU대량 병렬 계산 (그래픽 등)중간 — AI에도 쓸 수 있지만 전력 소모가 큼
NPUAI 연산 전용높음 — 같은 일을 훨씬 적은 전력으로

애플의 Neural Engine, 퀄컴의 Hexagon, 구글의 Tensor가 전부 이 계열의 칩이다. 스마트폰 신제품 발표에서 "AI 연산 성능이 몇 배 향상됐다"는 문구가 나올 때, 그건 대개 NPU의 연산 능력(흔히 TOPS, 초당 조 단위 연산 수로 표시)을 가리킨다.

⑥ 실전 — 지금 뭐가 되고 뭐가 안 되나

양자화와 NPU가 발전했다고 해서 서버급 AI가 전부 기기로 옮겨온 건 아니다. 지금 시점에서 온디바이스로 잘 되는 일과, 여전히 서버가 필요한 일은 갈려 있다.

구분예시이유
온디바이스로 잘 됨사진 속 얼굴·사물 인식, 실시간 번역, 키보드 다음 단어 예측, 짧은 요약모델이 작아도 되는 작업이거나 압축 손실을 감당할 만한 작업
여전히 서버 필요긴 문서 심층 분석, 복잡한 코드 생성, 최신 정보 검색이 필요한 질문큰 모델과 넓은 컨텍스트 윈도우가 필요하거나, 실시간 데이터에 접근해야 함
⚠️ "온디바이스 AI" 마케팅 문구를 볼 때 확인할 것
많은 제품이 "온디바이스 AI 탑재"를 내세우지만, 실제로는 일부 기능만 기기에서 돌고 복잡한 요청은 여전히 서버로 보내는 혼합 방식인 경우가 많다. "이 기능이 인터넷 없이도 되는가"를 직접 확인해보는 것이 마케팅 문구보다 정확하다 — 비행기 모드로 켜서 써보면 바로 드러난다.

⑦ 투자 관점 — 온디바이스 AI가 만드는 수요

온디바이스 AI가 늘어난다는 건 두 종류의 반도체 수요가 함께 커진다는 뜻이다.

  • NPU 자체 — 스마트폰·PC SoC(시스템온칩)에 AI 전용 회로가 표준으로 들어가는 추세는 반도체 설계·제조 수요로 이어진다. 이 흐름의 배경은 반도체 섹터 전망과 AI 반도체 삼국지에서 다뤘다.
  • 기기 안의 메모리 — 압축했다 해도 모델을 담고 돌리려면 램·저장공간이 더 필요하다. 마이크론의 최근 분기 실적에서 모바일·클라이언트 부문이 매출의 27.8%($11.52B)를 차지한 배경 중 하나가 이 수요다. 자세한 내용은 마이크론 실적 심층 분석에서 확인할 수 있다.

다만 이 글은 특정 종목의 수혜를 단정하지 않는다. 온디바이스 AI는 여러 반도체 수요 중 하나의 축일 뿐이고, 그 비중과 성장 속도는 위 딥리서치 아티클들이 다루는 데이터로 직접 확인하는 편이 낫다.

✅ 한 줄로 남길 것
온디바이스 AI는 서버 왕복을 없애는 대신 모델 크기를 양보하는 거래다. 양자화로 모델을 압축하고 NPU로 배터리를 아끼는데, 그 대가로 서버급 모델만큼 크고 정확하진 못하다. "온디바이스"라는 문구를 볼 때는 전부 기기에서 도는지, 일부만 그런지를 확인하는 습관이 마케팅 문구에 속지 않는 가장 확실한 방법이다.

※ 본 글은 2026년 8월 기준 일반 원리를 설명한 교육 자료입니다. 구체적인 모델 크기·양자화 비율·NPU 성능 수치는 제조사와 모델마다 다르며 빠르게 변합니다. 투자 관련 언급은 예시일 뿐 특정 종목의 매수·매도를 권유하지 않습니다.

※ 본 가이드는 일반 교육 목적의 참고 자료이며, 이해를 돕기 위해 기술적 세부사항을 단순화했습니다.

새 가이드가 나오면 알려드립니다

AI 리터러시 가이드는 주 2회 발행합니다. 구독하시면 다음 편을 메일로 보내드립니다. 무료이고 언제든 해지할 수 있습니다.

marketbrief 뉴스레터 구독하기

개인정보 수집 및 이용

뉴스레터 발송을 위한 최소한의 개인정보를 수집하고 이용합니다. 수집된 정보는 발송 외 다른 목적으로 이용되지 않으며, 서비스가 종료되거나 구독을 해지할 경우 즉시 파기됩니다.