처음보는 단어나 오타가 섞인 단어의 의미까지 유추해 내는 페이스북(Meta)의 걸작, FastText에 대해 알아본다.
1. FastText란 무엇인가?
FastText는 단어를 통째로 학습하던 기존의 방식(Word2Vec)에서 벗어나, 단어를 더 작은 단위 (글자 단위)로 쪼개서 학습하는 임베딩 기법이다.
Word2Vec은 'apple'이라는 단어를 하나의 덩어리로 본다. 하지만 FastText는 'apple'을 <ap, app, ppl, ple, le>처럼 여러 개의 조간(subword) 으로 나눈 뒤, 이 조각들의 의미를 각각 학습하고 나중에 합치는 방식을 사용한다.
쉬운 비유로 이해하기 : 한자어 유추하기
우리가 처음 보는 단어인 '초고속( 超高速)'을 만났다고 상상해 보세요 .
- Word2Vec 방식 : "초고속? 내 국어사전에 없는 단어네. 난 몰라!" (포기)
- FastText 방식 : "초고속? 처음 보지만 쪼개보다. '초(뛰어넘다)' + '고(높다)' + '속(빠르다)' ... 아! 엄청나게 빠르다는 뜻이구나!" (유추 성공)
이처름 FastText는 단어 안에 숨어있는 작은 조각( 어근, 접두사, 접미사 등)들의 알고 있기 때문에, 처음 보는 단어라도 조각 들을 조립해서 의미를 훌륭하게 유추해 낸다.
2. FastText의 3가지 강력한 장점
① 사전에 없는 단어(OOV) 처리 능력
가장 큰 장점이다. 신조어나 줄임말(예: '존맛탱', 'JMT')이 등장해도, 그 안에 포함된 글자 조각 ('맛', '탱')들의 의미를 이미 학습해 두었기 때문에 대략적인 의미를 파악할 수 있다.
② 오타에 매우 강함
사용자가 '사과'를 '사과ㅏ'라고 잘못 쳤다고 해봅시다. Word2Vec은 이를 완전히 새로운 단어로 인식하지만, FastText는 '사', '과'라는 조각이 겹치는 것을 보고 "아, '사과'를 잘못 친 거구나!"라고 유추하여 비슷한 벡터 값을 할당해 준다.
③ 희귀 단어(Rare words) 학습에 유리
자주 등장하지 않더라도 , 그 단어를 구성하는 글자 조각드은 다른 흔한 단어들에서 이미 많이 학습되었을 확률이 높아진다. 따라서 희귀 단어의 의미도 훨씬 정확하게 파악할 수 있다.
3. FastText의 단점은 없을까?
물론 완변한 기술은 없다. 단어를 잘게 쪼개서 학습하다 보니 발생하는 문제점도 있다.
- 학습 시간이 오래 걸림 : 단어 하나를 여러 개의 조각으로 나누어 각각 학습해야 하므로, Word2Vec에 비해 계산량이 훨씬 많고 학습 시간이 오래 걸린다.
- 메모리 사용량 증가 : 단어뿐만 아니라 수많은 글자 조각(subword)들의 벡터 값까지 모두 저장해야 하므로 모델의 용량이 커진다.
4. 한눈에 보는 비교 : Word2Vec vs FastText
| 비교 항목 | Word2Vec | FastText |
| 학습 단위 | 단어 전체를 하나의 덩어리로 학습 | 단어를 여러 개의 조각(Subword)으로 쪼개서 학습 |
| 모르는 단어 (OOV)처리 | 불가능(에러 발생 또는 무시) | 가능(조각들을 조합해 의미 유추) |
| 오타 대체 능력 | 매우 취약함 | 매우 강함 |
| 학습 속도 및 용량 | 빠르고 가벼움 | 느리고 무거움(조각들까지 계산/저장해야 함) |
| 한국어 적용 | 형태소 분석이 필수적임 | 자음/모음 단위로 쪼개면 한국어의 교착어 특성에 매우 유리함 |
마무리
FastText는 단어를 통째로 외우는 바보 같은 암기법에서 벗어나, 단어의 뿌리와 조각을 이해아혀 처음 보는 단어나 오타까지 척척 알아맞히는 똑똑한 임베딩 기술이다.
특히 띄어쓰거나 파괴되거나 신조어, 오타가 난무하는 인터넷 댓글, SNS 데이터를 분석할 때 FastText는 그야말로 빚을 발한다. 최신 LLM들이 서브워드 (Subword)로 토큰화를 사용하는 것도 바로 이 FastText의 철학과 맞당아 있다.
제미나이, 챗지피티 등을 이용 하여 작성
'LLM' 카테고리의 다른 글
| 32. 백오프(Backoff) (1) | 2026.07.23 |
|---|---|
| 30. DTM(Document-Term Matrix, 문서-단어 행렬) (0) | 2026.06.02 |
| 29. UMAP(Uniform Manifold Approximation and Projection) (0) | 2026.05.21 |
| 28. t-SNE(t-distributed Stochastic Neighbor Embedding) (0) | 2026.05.20 |
| 27. PCA (주성분 분석) (0) | 2026.05.19 |