Edge AI, 경량화 모델, SLM 그리고 AIoT가 향하는 방향
인공지능이 어떤 판단을 하려면 먼저 데이터가 필요하다. 공장의 베어링 고장을 예측하는 AI라면 진동 데이터를 받아야 하고, 카메라로 불량품을 판별하는 AI라면 영상을 받아야 한다. 음성비서라면 사용자의 음성을, 자율주행 시스템이라면 카메라와 레이더, 라이다 등에서 생성되는 데이터를 받아야 한다.
문제는 그** AI가 어디에 있는가**이다.
딥러닝이 본격적으로 확산되면서 많은 AI 시스템은 강력한 CPU와 GPU, 대용량 메모리를 갖춘 데이터센터와 클라우드에서 실행되어 왔다. 특히 복잡한 딥러닝 모델은 상당한 연산량을 요구하기 때문에 클라우드 서버에 모델을 두고, 사용자의 기기나 IoT 센서가 데이터를 서버로 전송하면 AI가 이를 분석한 뒤 결과를 돌려주는 방식이 자연스러운 선택이었다. NIST 역시 산업용 IoT에서 딥러닝의 높은 연산 요구량 때문에 클라우드 서버가 널리 활용되어 왔으며, 이 과정에서 IoT 데이터의 전송량과 네트워크 부하가 문제가 될 수 있다고 지적한 바 있다.
우리가 사용하는 많은 AI 서비스도 기본적으로 이러한 구조를 가지고 있다.
데이터가 AI를 찾아가는 구조다.
그러나 IoT 기기가 빠르게 증가하고 현실 세계의 더 많은 장치가 AI와 연결되기 시작하면서 이 구조에 근본적인 질문이 제기되고 있다.
모든 데이터를 굳이 멀리 있는 AI에게 보내야 하는가.
클라우드의 AI가 가진 역설
예를 들어 공장의 회전 설비에 진동 센서가 설치되어 있다고 생각해 보자.
센서는 베어링의 진동을 계속 측정하고 있다. 베어링 이상을 AI가 판단해야 한다면 가장 단순한 방법은 측정한 데이터를 클라우드로 보내는 것이다.
구조는 간단하다.
센서 → 인터넷 → Cloud → AI → 판단 결과 → 공장
하지만 센서와 설비의 수가 늘어나면 상황은 달라진다.
수많은 센서의 원시 데이터를 지속적으로 클라우드로 보내야 하고, 그만큼 네트워크 트래픽도 증가한다. 실시간 판단이 필요한 시스템이라면 데이터가 클라우드까지 이동하고 결과가 다시 돌아오는 시간도 문제가 된다. 인터넷 연결이 불안정하거나 단절되면 AI 서비스를 이용할 수 없는 상황도 발생한다.
데이터 측면에서도 문제가 있다. 공장의 생산 데이터나 기업의 기밀 데이터, 개인의 음성·영상처럼 민감한 정보를 매번 외부 서버로 보내는 것이 항상 바람직한 것은 아니다.
실제로 NIST는 네트워크 가장자리에서 생성되는 데이터가 빠르게 증가하면서 이를 과거처럼 모두 클라우드로 보내는 것이 어려워지고 있으며, 이러한 변화가 Edge AI의 중요한 배경이 되고 있다고 설명한다.
그렇다면 발상을 반대로 해볼 수 있다.
데이터를 AI에게 보내지 말고, AI를 데이터가 발생하는 곳으로 가져오면 어떨까.
컴퓨팅이 가까워졌다면, AI도 가까워질 수 있다
이미 컴퓨팅 분야에서는 비슷한 변화가 진행되어 왔다.
모든 데이터를 중앙 클라우드에서 처리하는 대신 데이터가 발생하는 곳 가까이에 컴퓨팅 자원을 배치하는** Edge Computing**과 Fog Computing이다.
그렇다면 그 컴퓨팅 자원에서 AI까지 실행하면 된다.
이것이 Edge AI의 기본적인 발상이다.
클라우드 서버에서 수행하던 AI 추론을 공장의 산업용 PC, 자동차의 컴퓨터, 스마트폰, 카메라, IoT 게이트웨이와 같은 엣지 장치에서 직접 수행하는 것이다. Edge AI에 대한 연구에서는 이를 중앙 클라우드가 아니라 사용자나 데이터가 존재하는 네트워크 가장자리에서 AI 연산을 수행하는 방식으로 설명한다.
베어링 예지 시스템이라면 구조가 이렇게 바뀔 수 있다.
기존
센서 → 원시 진동 데이터 전송 → Cloud AI → 이상 판단 → 결과 전송
Edge AI
센서 → 현장의 AI 모델 → 즉시 이상 판단 → 필요한 결과만 Cloud 전송
예를 들어 수많은 진동값을 모두 클라우드로 전송하는 대신 현장에서 AI가 먼저 분석한 뒤
정상 이상 징후 발견 베어링 점검 필요
와 같은 결과만 서버로 전송할 수 있다.
이렇게 되면 전송해야 하는 데이터의 양을 줄일 수 있고, 클라우드와의 통신 지연에 덜 의존하면서 빠르게 반응할 수 있다. 원시 데이터를 장치 밖으로 내보내지 않는 구조를 설계하면 데이터 프라이버시 측면에서도 장점을 얻을 수 있다. NIST의 산업 IoT 연구에서도 딥러닝 처리를 클라우드에서 엣지로 이전함으로써 데이터 전송 요구와 네트워크 부하를 줄일 수 있음을 제시했다.
하지만 여기에서 새로운 문제가 발생한다.
AI를 가까이 가져오려면 AI가 작아져야 한다
클라우드의 데이터센터와 공장 설비 옆에 설치된 작은 컴퓨터는 성능이 같지 않다.
데이터센터에는 여러 대의 고성능 GPU와 대용량 메모리, 충분한 전력을 공급할 수 있다. 반면 스마트폰, IoT 게이트웨이, 자동차, 웨어러블 기기와 같은 엣지 장치는 연산 능력과 메모리, 배터리, 발열에 제한이 있다.
아무리 Edge AI가 매력적이더라도 거대한 AI 모델을 그대로 작은 기기에 넣을 수 없다면 현실적으로 활용하기 어렵다.
따라서 새로운 질문이 등장한다.
**AI 모델을 더 작고 효율적으로 만들 수 없을까. ** 여기에서 AI 연구의 또 다른 중요한 축인 모델 경량화가 등장한다.
불필요한 연결이나 파라미터를 제거하는 Pruning, 모델이 사용하는 수치의 정밀도를 낮추는 Quantization, 큰 모델이 학습한 지식을 작은 모델에 전달하는 Knowledge Distillation 등이 대표적인 방법이다. 모델의 구조 자체를 모바일이나 엣지 환경에 맞게 작게 설계하는 연구도 활발하다. 최근 Edge AI 연구에서도 이러한 모델 압축과 경량화는 제한된 연산 능력과 메모리를 가진 장치에서 AI를 실행하기 위한 핵심 기술로 다뤄지고 있다.
따라서 AI 발전을 단순히 “모델을 계속 크게 만드는 과정”으로만 이해해서는 안 된다.
한쪽에서는 더 많은 파라미터와 데이터, 연산 자원을 활용하여 더욱 강력한 AI를 만드는 연구가 이루어진다.
동시에 다른 한쪽에서는
어떻게 하면 더 적은 자원으로 충분히 좋은 AI를 만들 수 있는가
라는 연구가 진행되고 있다.
성능의 극한을 높이는 연구와 효율을 높이는 연구가 동시에 이루어지고 있는 것이다.
거대한 LLM과 작은 SLM은 서로 다른 방향을 바라본다
이 변화는 최근의 언어모델에서도 뚜렷하게 나타난다.
ChatGPT와 같은 생성형 AI의 발전 과정에서 모델의 규모를 키우고 더 많은 데이터와 연산량을 활용하는 Large Language Model, LLM이 큰 주목을 받아왔다.
그러나 모든 AI가 거대한 범용 모델일 필요는 없다.
공장에서 설비 매뉴얼을 검색하고 작업자의 간단한 질문에 응답하는 AI, 자동차 안에서 음성 명령을 이해하는 AI, 스마트폰에서 사용자의 일정을 정리하는 AI라면 반드시 거대한 클라우드 모델이 필요한 것은 아니다.
특정한 목적에 충분한 능력을 갖춘 작은 언어모델을 사용할 수 있다면 연산량과 메모리 사용량을 줄이고 응답 시간을 단축하면서 로컬 장치에서 직접 실행할 가능성이 커진다.
이러한 배경에서 Small Language Model, SLM에 대한 관심도 커지고 있다.
중요한 것은 SLM이 LLM을 없애기 위한 기술은 아니라는 점이다.
오히려 앞으로는 역할이 나뉠 가능성이 크다.
간단하고 반복적인 작업이나 민감한 데이터를 처리하는 작업은 장치 안의 작은 모델이 담당하고, 복잡한 추론과 대규모 지식이 필요한 작업은 클라우드의 강력한 모델이 담당하는 방식이다.
즉,
Cloud의 대형 AI + Edge의 소형 AI
라는 협업 구조다.
IoT가 연결된 사물을 만들었다면, AIoT는 생각하는 사물을 만든다
여기에서 다시 IoT로 돌아가 볼 필요가 있다.
기존 IoT의 핵심은 사물을 연결하는 것이었다.
센서가 데이터를 측정하고 네트워크를 통해 서버로 보내면 서버가 이를 저장하고 분석했다.
그러나 AI를 엣지와 디바이스 안으로 가져오기 시작하면 사물의 역할 자체가 달라진다.
카메라가 단순히 영상을 보내는 것이 아니라 사람이나 불량품을 스스로 구분한다.
공장의 설비가 단순히 진동 데이터를 보내는 것이 아니라 자신의 이상 상태를 판단한다.
자동차가 센서 데이터를 서버로 전달하는 데 그치지 않고 주변 상황을 실시간으로 인식한다.
이처럼 AI와 IoT가 결합된 구조를 AIoT(Artificial Intelligence of Things)라고 부른다. 최근 AIoT 연구에서는 IoT 기기가 데이터를 수집하고 연결하는 기능에 AI의 분석·추론·최적화 능력이 결합되면서 보다 지능적인 시스템으로 발전하는 구조를 AIoT로 설명한다.
AIoT가 반드시 모든 AI를 기기 내부에서 실행한다는 의미는 아니다.
AI가 클라우드에 있을 수도 있고, 엣지에 있을 수도 있으며, 두 곳이 역할을 나눌 수도 있다. 실제로 최근에는 클라우드와 엣지의 장점을 결합하는 Edge–Cloud 협업형 AIoT 역시 중요한 구조로 연구되고 있다.
하지만 분명한 변화가 하나 있다.
AI가 더 이상 데이터센터 안에만 머무르지 않는다는 것이다.
이제 데이터만 움직이는 것이 아니라 AI도 움직인다
클라우드 컴퓨팅의 발전은 우리가 강력한 컴퓨팅 자원을 인터넷 너머에서 사용할 수 있도록 만들었다.
그러나 IoT의 확산으로 현실 세계 곳곳에서 막대한 데이터가 생성되기 시작하면서 모든 데이터를 중앙으로 가져오는 방식만으로는 해결하기 어려운 문제가 나타났다.
그래서 컴퓨팅이 Edge로 이동했고, 이제는 AI도 그 길을 따라가고 있다.
이를 가능하게 만드는 것이 더 효율적인 AI 아키텍처와 모델 경량화이며, 언어모델 분야의 SLM 역시 이러한 변화와 맞닿아 있다.
따라서 AI 발전을 바라볼 때 거대한 모델의 파라미터 수와 성능 경쟁만 볼 필요는 없다.
또 하나의 경쟁이 동시에 진행되고 있다.
얼마나 강력한 AI를 만들 것인가의 경쟁과, 얼마나 작고 효율적으로 AI를 현실 세계에 배치할 것인가의 경쟁이다.
IoT가 현실 세계의 사물을 인터넷에 연결했다면, AIoT는 그 연결된 사물에 분석과 판단 능력을 더하고 있다.
그리고 그 변화의 핵심은 어쩌면 매우 단순한 질문에서 시작된다.
데이터를 AI가 있는 곳까지 계속 보내야 하는가. 아니면 AI가 데이터가 있는 곳으로 가면 되는가.
AI가 클라우드에서 엣지로, 그리고 결국 디바이스 안으로 이동하기 시작하면서 우리는 그 두 번째 답을 현실에서 보기 시작하고 있