728x90
반응형
SMALL

자연어 처리(NLP)에서 단어를 벡터로 표현하는 방법은 크게 두 가지로 나뉜다.

  • 예측 기반 (Prediction-Based)
  • 카운트 기반 (Count-Based)

두 방식 모두 단어의 의미를 숫자로 표현한다는 공통점이 있지만, 학습 방식과 특징에는 큰 차이가 존재한다. 

 

 

1. 카운트 기반 (Count-based) 방식

"전체 문맥의 통계를 숫자로 기록하다"

-> 카운트 기반 방식은 단어의 빈도와 통계 정보를 확용하여 벡터를 생성한다. 

카운트 기반 방식은 말뭉치 (Corpus) 전체에서 특정 단어들이 함께 얼마나 자주 등장하는 지를 통계적으로 수치화한다. 

  • 대표 알고리즘 : LSA(잠재 의미 분석), TF-IDF, 단순 빈도스(Count Vectorizer), BoW(Bag of Words)
  • 핵심 원리 : 문서 - 단어 행렬 (DTM)이나 동시 등장 행렬을 만들고, 수학적 기법 (SVD 등)을 사용해 차원을 축소한다. 
  • 핵심 아이디어 : 함께 등장하는 단어는 의미가 비슷하다
    • 단어 빈도
    • 동시 등장( Co-occurrence) 
    • 등을 기반으로 의미를 추론한다. 
  • 특징 :
    • 말뭉치 전체의 글로벌한 통계 정보를 잘 반영한다. 
    • 학습 속도가 빠르고 결과가 직관적이다. 
    • 하지만 단어 간의 복잡한 유사성이나 문맥적 의미를 정교하게 잡는 데는 한계가 있다. 
  • 방식 :
    단어 - 문서 행렬 생성 
    • 통계 계산
    • 차원 축소 (SVD)
    • 단어 벡터 생성
  • 장점 :
    • 해석이 쉬움
    • 작은 데이터에서도 안정적
    • 통계 기반으로 직관적
  • 단점 :
    • 희소 행렬 문제
    • 차원 매우 큼
    • 문맥 반영 어려움
    • 성능 한계 존재 
반응형

2. 예측 기반 (Prediction-based) 방식

"주변 단어로 중심 단어를 맞히며 학습하다"

예측 기반 방식은 신경망 (Neural Network)을 이용해 특정 단어 주변에 어떤 단어가 올지, 혹은 주변 단어를 보고 중심 단어가 무엇일지를 예측하는 과정에서 벡터값을 학습한다. 

  • 대표 알고리즘 : Word2Vec(CBOW, Skip-gram), FastText
  • 핵심 원리 : 단어를 저차원의 밀집 벡터 (Dense Vecotr)로 매핑하고, 오차를 줄여나가는 방식으로 가중치를 업데이트 한다. 
  • 핵심 아이디어 :
    비슷한 문맥에서 등작하는 단어는 의미도 비슷하다. 
  • 특징 : 
    • 단어 간의 의미적 관계(유사도)를 매우 잘 포착한다. (예: 왕 - 남자 + 여자 = 여왕)
    • 희소 행렬 문제를 해결하여 메모리 효율이 좋다.
    • 대규모 말뭉치 학습 시 성능이 뛰어나지만, 전체적인 통계 정보를 놓칠 수 있다는 단점이 있다. 
  • 방식 :
    주변 단어 예측
    • 신경망 학습
    • 임베딩 벡터 생성
  • 장점 :
    • 의미 관계 표현 우수
    • Dense Vector 생성
    • 성능 우수
    • 차원 효율적
  • 단점 : 
    • 학습 비용 필요
    • 해석 어려움
    • 데이터 적으면 성능 저하
728x90

 

3. 비교표

직과적인 차이

카운트 기반 :

몇 번 같이 나왔는가 ?

-> 빈도 중심

예측 기반 : 

주변 단어를 얼마나 맞추는가 ?

-> 학습 중심

 

비교 항목 카운트 기반 예측 기반
방식 통계 신경망 예측
기본 철학 단어의 빈도와 통계를 분석 문맥을 통해 다음 단어를 예측
대표 모델 LSA Word2Vec
학습 단위  말뭉치 전체(Global) 윈도우 기반 국소 문맥(Local)
데이터 활용 전체 통계 로컬 문맥
벡터 ㅌ특성 Sparse 가능 Dense
장점 전체적인 통계 정보 반영이 뛰어남 단어 간 유사도 및 의미 관계 포착이 뛰어남
단점 의미적 유사성 표현이 상대적으로 부족 말뭉치 전체의 통계 정보를 활용하지 못함
결과물 주로 Sparse Matrix( 희소 행렬) Dense Vector(밀집 벡터)
성능 비교적 낮음 우수
해석 쉬움 어려움

 

 

4. GloVe

이 두 방식의 장점만을 합치려는 노력이 있었다. 바로 우리가 배웠던 GloVe이다. GloVe는 '카운트 기반'의 전체 통계 정보와 '예측 4기반'의 유사도 학습 방식을 결합하여 현대 NLP의 성능을 한 단계 끌어올렸다. 

 

5. 어떤 방식을 선택해야 할까 ?

  • 단순한 키워드 추출이나 문서 분류가 목적이라면 학습이 빠르고 명확한 카운트 기반 (TD-IDF 등)이 유리할 수 있다. 
  • 단어의 깊은 의미 관계나 문장 생성, 챗봇 등 고도의 언어 이해가 필요하다면 예측 기반(Word2Vec, 임베딩) 방식이 필수적이다.

최근의 LLM(거대 언어 모델)들은 기본적으로 예측 기반의 임베딩을 사용하면서도, 거대한 데이터를 통해 통계적으로 정보까지 모두 흡수하는 방향으로 발전하고 있다. 

-> 예측 기반 + Transformer 구조

 

-> 카운트 기반은 "통계", 예측 기반은 "학습"으로 단어 의미를 표현한다.

 

6. 정리

카운트 기반 임베딩은 단어의 등장 빈도와 통계 정보를 활용하는 전통적인 방식이며, 예측 기반 임베딩은 신경망을 통해 주변 단어를 예측하면서 의미를 학습하는 방식이다. 현대 NLP에서는 주로 예측 기반 모델이 사용되지만, 카운트 기반 방식 역시 기본 개념 이해에 매우 중요하다. 

 

제미나이, 챗지피티 등을 이용 하여 작성

728x90
반응형

'LLM' 카테고리의 다른 글

21. Bag Of Words(BoW)  (0) 2026.05.11
20. 예측 기반(Prediction-based)  (0) 2026.05.08
18. CSC ( Compressed Sparse Column )  (0) 2026.05.06
17. CSR ( Compressed Sparse Row)  (0) 2026.05.04
16. COO( Coordinate list)  (0) 2026.04.30

+ Recent posts