2026년 8월 19일, 현대자동차그룹의 글로벌 소프트웨어 센터 **42dot(포티투닷)**이 연 Gleo AI 테크 세션에 다녀왔습니다. 기술 발표 4개 영역과 개발자 Q&A에서 보고 들은 이야기를 처음 보는 분도 따라올 수 있게 정리했어요.

<aside> 💬 '글레오'는 무슨 뜻일까요? 차에 타서 직접 물어봤더니 — 이름은 천문학자 **갈릴레오 갈릴레이(Galileo Galilei)**에서 따왔다고 해요. 갈릴레오가 천체 관측으로 인류에게 새로운 세상을 보여준 것처럼, 차 안의 AI 경험과 모빌리티 기술의 새로운 지평을 열겠다는 의미를 담았다고 합니다 🙂

</aside>

1. Gleo AI와 '에이전틱 모빌리티'

Gleo AI는 42dot이 개발하고 있는 LLM 기반 차량용 AI 에이전트입니다. 지난 5월 신형 그랜저를 시작으로 이미 도로 위 차에서 쓰이고 있어요. 42dot은 이 기술로 '에이전틱 모빌리티(Agentic Mobility)' 단순히 음성 명령을 알아듣는 걸 넘어, 사용자의 의도와 상황을 이해하고 실제 행동까지 자연스럽게 이어주는 이동 경험을 지향한다고 소개했습니다.

<aside> ▫️ 💡 생성형 AI vs 에이전틱 AI, 뭐가 다른가요? ・생성형 AI는 내 말(프롬프트)을 이해하고 '답(Answer)'을 만들어 주는 데 초점을 맞춰요. ・**에이전틱 AI(Agentic AI)**는 내 말을 '목표(Goal)'로 받아들여요. 상황을 파악해 스스로 계획을 세우고, 필요한 도구(Tool)를 써서 실제 '행동(Action)'까지 한 다음, 결과가 맞는지 되짚어 확인합니다.

</aside>

차 안에서 이게 왜 필요할까요? 운전자는 기능 이름으로 말하지 않아요. **"조금 덥네", "가는 길에 충전소 찾아줘"**처럼 자기 목표와 상황을 중심으로 말하죠. 그래서 차량 AI는 말 자체만이 아니라 현재 위치, 경로, 차 상태, 이전 대화까지 실시간으로 바뀌는 맥락을 함께 이해해야 합니다.

"가는 길에 충전할 수 있는 곳 찾아서 경로에 추가해 줘" 같은 간단한 한마디도, 안에서는 음성 인식 → 의도 파악 → 맥락 확인 → 계획 → 검색 → 후보 선택 → 사용자 확인 → 경로 반영까지 여러 단계가 이어져요. Gleo AI의 목표는 이 복잡한 과정을 끊기지 않는 하나의 경험으로 만드는 것입니다.

<aside> ▫️ 공식 명칭은 Vehicle Native AI Agent — 차의 상태, 주행 맥락, 안전성, 응답 속도 같은 차량 환경의 특성을 처음 설계 단계부터 고려해 만든 에이전트라는 뜻이에요.

</aside>

2. AI Agent — 상황을 이해하고, 계획해서, 실행합니다

에이전트가 요청 하나를 처리하는 과정은 **'맥락 이해 → 대화 이해 → 작업 분해 → 정보 준비 → 사용자 확인 → 실행'**의 6단계예요. 여러 전문 에이전트와 도구가 협업해 하나의 경험으로 완성됩니다.

<aside> ⚙️ 어떻게 움직이나요

<aside> 🛡️ 신뢰를 지키는 3가지 원칙 (Safe and Grounded Intelligence)

3. Gleo AI LLM — 말뜻을 헤아리는 두뇌

차량용 LLM은 품질·속도·비용 세 가지를 동시에 만족해야 하는 어려운 과제(트릴레마)를 안고 있어요. Gleo AI 팀이 이를 푸는 방식은 이렇습니다.

<aside> 🧠 개발 전략

4. Speech Technologies — 시끄러운 차 안에서 또렷하게 듣고 말하기

차 안은 엔진 소음, 음악, 동승자 대화가 뒤섞인 환경이라 고도화된 음성 기술이 필수예요. 사용자의 말은 아래 6단계 파이프라인을 거쳐 처리됩니다.

<aside> 🎙️ 음성 처리 6단계

  1. DSP — 소음 제거, 음원 분리, 에코 제거로 깨끗한 음성 신호를 만들어요.
  2. WWD (호출어 인식) — 부르는 말을 빠르고 정확하게 알아챕니다.
  3. EPD (말 끝 감지) — 발화의 시작과 끝을 정확히 판단해, 말이 잘리거나 응답이 늦어지는 걸 막아요.
  4. STT (음성 → 텍스트) — 목적지·앱 이름처럼 차량에서 자주 쓰는 용어는 별도 보정 기술로 정확도를 높입니다.
  5. TN (텍스트 정리) — '220V'를 '이백이십볼트'로 바꾸듯, 문맥에 맞는 자연스러운 발화용 문장을 만들어요.
  6. TTS (텍스트 → 음성) — 알맞은 발음·속도·억양으로 자연스러운 음성을 합성합니다. </aside>

<aside> ▫️ 다음 단계로는 말의 의미가 완결됐는지로 발화 종료를 판단하는 Semantic VAD, 사람처럼 들으면서 동시에 말하는 Full-duplex 대화, 상황에 맞는 말투로 답하는 Instruction based TTS를 연구하고 있어요.

</aside>

5. 개발자 Q&A — 현장에서 오간 질문들