BC카드, AI 모델 69% 경량화,처리속도 3배 높였다

BC카드, AI 모델 69% 경량화,처리속도 3배 높였다

1. 먼저 “69% 경량화”가 무슨 뜻인가?

AI 모델에는 수많은 파라미터(parameter)가 있습니다.

쉽게 말하면 AI가 학습하면서 만들어 놓은 엄청나게 많은 숫자라고 생각하면 됩니다.

예를 들어,

원래 AI 모델이 100GB

라고 가정해보겠습니다.

경량화를 해서 69% 줄였다면,

100GB → 약 31GB

가 됩니다.

AI의 지식 자체를 단순히 69% 삭제한다는 뜻은 아닙니다.

핵심은 같은 모델이 필요로 하는 메모리와 연산량을 줄이는 것입니다.

BC카드가 공개한 관련 기술에서는 특히 양자화(quantization)가 중요한 역할을 합니다. 2025년 공개 사례에서 BC카드는 모델 크기를 70% 이상 줄이면서도 기존 정확도를 유지하는 ‘손실률 0%’ 양자화를 구현했다고 설명했습니다.

2. 핵심 기술은 “양자화”입니다

이 부분이 가장 중요합니다.

AI는 내부적으로 숫자를 엄청나게 많이 계산합니다.

예를 들어 어떤 숫자가

1.23456789

처럼 매우 정밀하게 표현되어 있다고 해보죠.

AI가 모든 계산에서 이렇게 긴 숫자를 사용할 필요가 없는 경우가 많습니다.

그래서 숫자를 더 작은 형태로 바꿉니다.

이를 양자화(Quantization)라고 합니다.

쉽게 비유하면

원래 AI가 계산할 때

📚 숫자책 100권을 들고 다님

양자화를 하면

📕 핵심 내용만 압축해서 30권 정도로 들고 다님

그런데 중요한 것은 내용을 함부로 버리지 않는 것입니다.

BC카드는 동적 양자화 기술을 사용해 AI 모델의 수치 표현을 압축하고, 실제 계산 과정에서 이를 활용하는 방식을 적용했습니다. 회사 측은 정확도 손실을 최소화하거나 관련 공개 모델에서 ‘손실률 0%’를 달성했다고 설명했습니다.

3. 왜 AI 모델을 작게 만드는 게 그렇게 중요한가?

가장 큰 이유는 GPU 비용입니다.

대규모 AI 모델을 돌리려면 GPU가 필요합니다.

그런데 GPU는 상당히 비쌉니다.

특히 금융회사에서 AI를 실제 서비스에 적용하면 한두 번 질문하는 수준이 아닙니다.

BC카드는 연간 100억 건 이상의 결제 데이터를 처리해온 경험을 바탕으로 AI 운영 구조를 구축하고 있다고 밝혔습니다.

예를 들어 하루에 수백만 건의 AI 추론이 발생한다고 생각해보겠습니다.

AI 한 번 계산할 때 GPU를 많이 사용하면,

AI 사용량 증가 GPU 증가 서버 비용 증가 전력비 증가

라는 구조가 됩니다.

따라서 모델을 작게 만들면

모델 경량화 GPU 메모리 사용 감소 더 저렴한 GPU 사용 가능 운영비 감소

가 됩니다.

4. 실제로 얼마나 차이가 나는가?

BC카드가 2025년에 공개한 사례가 상당히 흥미롭습니다.

BC카드는 양자화한 320억 개 파라미터 규모의 모델을 기존에는 약 4,000만원대 고가 GPU가 필요했던 환경에서, 약 300만원대 GPU에서도 구동할 수 있었다고 설명했습니다.

엄청난 차이죠.

단순화해서 생각하면,

4,000만원짜리 GPU

300만원대 GPU

로 낮출 수 있다는 이야기입니다.

물론 이것을 모든 AI 모델과 모든 환경에 그대로 적용할 수 있다는 뜻은 아닙니다. 특정 모델·하드웨어·벤치마크 조건에서 나온 결과라는 점은 구분해야 합니다.

5. 그런데 왜 “3배 빨라졌다”는 것인가?

AI가 답을 만드는 과정에는 추론(inference)이라는 계산 과정이 있습니다.

사용자가

“이번 달 소비 내역을 분석해줘.”

라고 요청하면,

AI가 모델을 이용해 입력을 계산하고 결과를 만들어냅니다.

이때 모델이 너무 크면 계산량이 많습니다.

반대로 모델이 작아지고 계산이 효율화되면,

입력

AI 계산

결과

까지 걸리는 시간이 줄어듭니다.

BC카드는 2025년 공개한 양자화 LLM에서 최대 3.5배의 AI 연산 속도 향상을 제시했습니다.

2026년에는 FP8 동적 양자화를 활용해 모델 크기를 약 50% 줄이고 최대 3배 성능 향상을 얻었다는 별도의 발표도 확인됩니다.

따라서 기사에서 말하는 “3는 단순히 인터넷 속도가 3배가 된다는 의미가 아니라, AI 모델의 추론/연산 처리 성능이 크게 향상됐다는 의미로 이해하는 게 정확합니다.

6. 여기서 FP8은 또 무엇인가?

조금 더 기술적으로 들어가면 재미있는 부분입니다.

AI는 숫자를 표현할 때 여러 가지 정밀도를 사용할 수 있습니다.

대표적으로

  • FP32
  • FP16
  • BF16
  • FP8

등이 있습니다.

여기서 FPFloating Point, 즉 부동소수점을 뜻합니다.

아주 단순하게 보면,

더 높은 정밀도 = 더 많은 정보를 표현할 수 있지만 계산·메모리 부담 증가

입니다.

반대로

낮은 정밀도 = 메모리와 계산량 감소

라는 장점이 있습니다.

그래서 AI에서는 정확도를 크게 떨어뜨리지 않는 범위에서 숫자 표현을 줄이는 것이 굉장히 중요합니다.

BC카드가 2026년에 공개한 사례에서는 FP8 동적 양자화를 적용해 모델 크기와 추론 성능을 개선했다고 알려졌습니다.

7. 그런데 BC카드의 진짜 중요한 변화는 이것입니다

사실 저는 “69% 줄였다보다 2026년에 발표한 AI 구조가 더 중요하다고 봅니다.

BC카드는 모든 업무를 하나의 거대한 AI 모델에게 맡기는 대신,

큰 AI 하나

가 아니라

작은 AI 여러 개

를 연결하는 방향으로 가고 있습니다.

이게 바로 SLM(Small Language Model)입니다.

예를 들어 회사에서 다음과 같은 업무가 있다고 해봅시다.

  • 고객 민원 분류
  • 가맹점 심사
  • 내부 문서 검색
  • 결제 데이터 분석
  • 상품 추천
  • 마케팅 문구 생성

예전 방식이라면,

거대한 LLM 하나가 모든 일을 처리

하도록 만들 수 있습니다.

BC카드가 추진하는 방식은 다릅니다.

AI 업무 요청

┌───────┴───────┐

│ AI Router │

└───────┬───────┘

┌──────────────┼──────────────┐

↓ ↓ ↓

민원 AI 심사 AI 추천 AI

작은 모델 작은 모델 작은 모델

│ │ │

└──────────────┼──────────────┘

결과

업무마다 가장 적합한 작은 AI를 선택해서 사용하는 것입니다.

BC카드는 2026년 공개한 ‘Agentic AI 운영 플랫폼’에서 업무별 특화 소형언어모델을 연결하는 구조를 소개했고, 이 방식으로 추론 속도 최대 3배 이상 향상, GPU 자원 최대 70% 절감 효과를 제시했습니다.

8. 왜 작은 AI 여러 개가 큰 AI 하나보다 유리할까?

예를 들어 직원이

“지난달 고객 민원 중 배송 관련 민원만 분류해줘.”

라고 요청했다고 합시다.

이건 엄청나게 어려운 작업이 아닙니다.

그런데 수백억 개 파라미터를 가진 거대한 LLM에게 이 일을 시키면 필요 이상으로 큰 계산을 하게 될 수 있습니다.

반면

민원 분류 전용 SLM

을 만들어놓으면 훨씬 효율적으로 처리할 수 있습니다.

즉,

망치로 못 하나를 박는 것과 같습니다.

작은 못 하나를 박는데 거대한 산업용 기계를 사용할 필요는 없습니다.

9. 이게 금융회사에서는 특히 중요합니다

금융 데이터는 일반적인 데이터와 성격이 다릅니다.

예를 들어 BC카드에는

  • 결제 금액
  • 결제 시간
  • 가맹점
  • 업종
  • 지역
  • 소비 패턴
  • 고객 행동
  • 거래 정보

등 다양한 데이터가 존재합니다.

AI가 이것을 분석하면

“이 고객은 주말 저녁에 특정 지역에서 외식 소비가 많다.”

같은 패턴을 찾아낼 수 있습니다.

이를 바탕으로

“이 고객에게 어떤 혜택을 보여줄까?”

를 결정할 수 있습니다.

그래서 BC카드는 AI를 단순한 챗봇이 아니라 금융 서비스 자체에 연결하는 방향으로 확대하고 있습니다.

10. 실제 서비스에도 적용되고 있습니다

BC카드는 이미 여러 AI 서비스를 운영하고 있습니다.

대표적으로 Eat.pl 같은 상권·맛집 관련 서비스, BCGPT 같은 금융 특화 생성형 AI, 그리고 여러 AI를 연결해 업무 자동화를 수행하는 MOAI 등이 있습니다.

2025년 공개 자료에서는 AI 에이전트 MOAI를 통해

  • 내부 지식 검색
  • 가맹점 심사 자동화
  • 고객 민원 분류

등의 업무를 지원한다고 설명했습니다.

즉,

AI 연구실에서 실험한 기술

이 아니라

실제 금융회사 업무에 AI를 넣기 위한 기술

이라는 것이 중요합니다.

11. 최근에는 “모델”보다 “데이터”도 중요해지고 있습니다

2026년 7월 BC카드는 MongoDB와 AI 데이터 플랫폼 고도화를 추진한다고 발표했습니다.

여기서도 핵심은 AI 모델 하나가 아닙니다.

AI가 사용할 데이터를 얼마나 빠르고 정확하게 찾느냐가 중요합니다.

BC카드는 텍스트·이미지·상품 정보 등 다양한 비정형 데이터를 관리하고, 자연어 검색과 AI 추천 기능을 강화하는 방향을 추진하고 있습니다.

예를 들어 고객이

“강남에서 지난 주말에 사람들이 많이 간 식당 알려줘.”

라고 물었다고 합시다.

AI 모델만 좋아서는 안 됩니다.

AI가

  • 결제 데이터
  • 가맹점 정보
  • 지역 정보
  • 시간 정보
  • 업종 정보

를 찾아서 연결해야 합니다.

따라서 AI 모델 + 데이터베이스 + 검색 + 추천 + 에이전트가 하나의 시스템으로 연결되는 것입니다.

12. 그래서 BC카드가 궁극적으로 만들려는 것은?

단순히

“우리도 ChatGPT 같은 걸 만들겠다.”

가 아닙니다.

보다 정확하게는

금융 특화 AI 인프라

를 만들려는 것입니다.

구조를 단순화하면 이렇게 볼 수 있습니다.

[고객 / 직원]

AI Agent / 서비스

┌─────────┴─────────┐

↓ ↓

대형 LLM 소형 SLM

어려운 작업 전문 업무

│ │

└─────────┬─────────┘

AI 데이터 플랫폼

┌───────────┼───────────┐

↓ ↓ ↓

결제 데이터 가맹점 데이터 상품 데이터

결과 생성

이 구조가 잘 만들어지면 AI 하나하나를 새로 만드는 것보다 여러 금융 서비스를 빠르게 AI화할 수 있습니다.

13. “69% 경량화”가 기업 입장에서 중요한 이유

결국 돈으로 환산하면 이해하기 쉽습니다.

가령 어떤 AI 서비스가 GPU 10대를 필요로 한다고 해보겠습니다.

모델 최적화 후 필요한 자원이 크게 줄어든다면,

GPU 10대 → 5~7대 수준

으로 줄어드는 식의 효과를 기대할 수 있습니다.

그러면

GPU 구매비

클라우드 사용료

전력비

서버 공간

발열/냉각 비용

가 됩니다.

그리고 AI 처리 속도가 빨라지면

동일 시간에 더 많은 요청 처리

도 가능합니다.

그래서 AI 산업에서는 단순히

“모델의 성능이 얼마나 좋은가?”

만 보는 게 아니라

성능 대비 비용이 얼마나 싼가?”

가 매우 중요한 경쟁력이 되고 있습니다.

14. 특히 금융권에서는 이게 엄청난 차이를 만듭니다

금융회사 AI의 특징은 사용량이 많고, 정확성과 안정성이 중요하다는 것입니다.

예를 들어 하루 100건 처리하는 AI라면 비용 최적화가 상대적으로 덜 중요할 수 있습니다.

하지만 수백만~수천만 건의 데이터를 처리한다면 이야기가 완전히 달라집니다.

AI 요청 하나당 비용을 아주 조금만 줄여도

하루 수백만 번 × 365일

이 되면 상당한 비용 차이가 발생합니다.

그래서 BC카드가 강조하는 것은

더 큰 AI”가 아니라 효율적인 AI”입니다.

15. 다만 기사에서 숫자를 볼 때 주의해야 합니다

여기가 중요합니다.

“69% 줄었다 = 모든 AI 모델이 69% 작아진다

라는 뜻은 아닙니다.

“3배 빨라졌다 = 모든 상황에서 정확히 3배 빨라진다

도 아닙니다.

실제 성능은

  • 어떤 모델인지
  • 파라미터가 몇 개인지
  • GPU가 무엇인지
  • FP8/FP16 등 어떤 정밀도를 사용하는지
  • 입력 데이터가 얼마나 큰지
  • 배치 크기가 얼마인지
  • 동시에 몇 명이 사용하는지
  • 어떤 소프트웨어 최적화를 했는지

에 따라 달라집니다.

따라서 기사 속 최대 3라는 표현은 특정 테스트·환경에서 얻은 최고 성능으로 이해하는 게 좋습니다.

16. 전체 기술을 한 문장으로 정리하면

BC카드의 전략은

비싼 GPU를 계속 추가하는 대신 AI 모델을 양자화하고 경량화하며, 업무별로 작은 AI 모델을 배치하고, 필요한 데이터만 효율적으로 연결해서 더 빠르고 저렴한 금융 AI 시스템을 만들겠다.”

라고 볼 수 있습니다.

그리고 이 전략에는 크게 4가지 기술이 들어갑니다.

기술하는 일효과
양자화AI 숫자 표현을 효율화모델·메모리 감소
모델 경량화불필요한 연산 부담 감소빠른 추론
SLM업무별 작은 AI 사용비용 절감·속도 향상
AI 데이터 플랫폼필요한 데이터를 빠르게 검색·연결AI 서비스 품질 향상

17. 가장 중요한 포인트 3개만 기억하면 됩니다

① 69% 경량화의 핵심은 “AI를 버린 것”이 아니다

AI 모델을 더 효율적인 형태로 압축해서 메모리와 연산 부담을 줄인 것입니다.

② 3배 속도의 핵심은 모델 최적화

단순히 GPU를 더 많이 꽂은 것이 아니라 양자화·경량화·소프트웨어 최적화 등을 통해 같은 자원에서 더 많은 연산을 처리하려는 것입니다. 관련 BC카드 사례에서는 최대 3~3.5배의 성능 향상이 제시됐습니다.

③ 진짜 큰 그림은 “작은 AI 여러 개”

BC카드는 하나의 거대한 AI가 모든 일을 하는 방식에서 벗어나 업무별 특화 SLM을 여러 개 연결하는 Agentic AI 구조로 확장하고 있습니다. 이 구조에서는 GPU 자원을 최대 70% 줄이고 추론 속도를 최대 3배 높였다고 설명합니다.

한마디로 비유하면

예전에는 슈퍼컴퓨터 한 대가 모든 일을 처리했다면,

BC카드가 가는 방향은

작고 전문적인 AI 직원 10명이 각자 자기 일을 처리하고, AI 관리자가 필요한 직원에게 일을 배분하는 회사

에 가깝습니다.

그래서 AI의 크기를 줄이면서도 속도와 비용 효율을 동시에 잡는 것이 핵심입니다.