728x90
반응형
SMALL

1. TF-IDF란 무엇인가요?

TF-IDF(Term Frequency-Inverse Document Frequency)는 여러 문서로 이루어진 문서군(Corpus)에서 어떤 단어가 특정 문서 내에서 얼마나 중요한 것인지를 나타내는 통계적 수치이다. 

단순히 횟수만 세면 the, a, 이, 가 같은 의미 없는 불용어(Stopwords)가 가장 중요한 단어로 취급되는 문제가 생긴다. 이를 해결하기 위해 TF-IDF(Term Frequency-Inverse Document Frequency) 기법을 사용한다. 

이름이 조금 길고 복잡해 보이지만, 사실 두 가지 개념이 합쳐진 것이다. 

  • TF (단어 빈도) : 특정 문서에서 단어가 많이 나올수록 중요도가 높다고 판단.
  • IDF (역문서 빈도) : 여러 문서에 두루두루 등장하는 흔한 단어는 중요도를 낮게 평가.
  • 결과: 특정 문서에서만 유독 많이 등장하는 '핵심 키워드'를 찾아낼 수 있다.
  • 예측 기반(Word2Vec) : 원도우를 옮겨가며 주변 단어를 예측한다. (단어 간 유사도 파악에 유리)

즉, 이 문서에서는 엄청 자주 나오는데, 다른 문서들에게는 거의 안 나오는 단어일수록 TF-IDF 점수가 높아지고, 핵심 키워드로 인정받게 된다. 

쉬운 비유로 이해하기

'전국 맛집 탐방기'라는 책을 읽고 있다고 상상해 보세요 .

  • TF (단어 빈도) :  책에서 "맛있다"라는 단어가 100번 나왔다. (점수 상승)
  • IDF (역문서 빈도) : 그런데 "맛있다"라는 단어는 요리책, 소설책, 일기장 등 세상의 모든 책에 다 나오는 흔한 단어이다. (점수 하락)
  • 결과 : "맛있다"는 이 책의 고유한 특징을 나타내는 핵심 단어가 아니다.

반면, "평양냉면"이라는 단어는 어떨까요?

  • TF : 이 책에서 50번 등장했습니다. (점수 상승)
  • IDF : 다른 일반적인 책들에서는 거의 등장하지 않는 아주 희귀한 단어입니다. (점수 상승)
  • 결과: "평양냉면"의 TF-IDF 점수는 매우 높아지며, 이 책의 핵심 키워드로 선정된다!

반응형

2. TF-IDF의 계산 원리

수학 공식이 들어가지만, 원리만 알면 아주 간단한다. 

  1. TF(Term Frequency)
    특정 문서 d에서 특정 단어 t가 등장한 횟수이다. 
    예 : A문서에서 '인공지능'이 5번 등장했다면 TF=5
  2. DF(Document Frequency)
    특정 단어 t가 등장한 문서의 수이다. 단어가 몇 번 등장했는지가 아니라, 몇 개의 문서에 등장했는지를 센다.
    예 : 총 100개의 문서 중 '인공지능'이라는 단어가 포함된 문서가 10개라면 DF-10 
  3. IDF(Inverse Document Frequency)
    DF의 역수(Inverse)이다. 즉, 단어가 흔할수록 숫자가 작아지고, 희귀할수록 숫자가 커지도록 수학적으로 뒤집어진 값이다. (보통 로그(log)를 씌워 값이 너무 커지는 것을 방지한다.)
  4. 최종 TF-IDF 점수 
    TF-IDF = TF x IDF 단순히 두 값을 곱해지면 끝이다! 이 점수가 높을수록 해당 문서에서 그 단어의 중요도가 높다는 뜻이다.

3. TF-IDF는 어디에 쓰일까요?

TF-IDF는 딥러닝이 등장하는 전부터 지금까지도 자연어 처리 분야에서 아주 유용하게 쓰이고 있다.

  1. 검색 엔진 : 여러분이 구글이나 네이버에 검색어를 입력했을 때, 수백만 개의 웹문서 중 검색어의 TF-IDF 점수가 가장 높은 문서를 맨 위로 올려준다. 
  2. 핵심어(Keyword) 추출 : 긴 뉴스 기사나 논문에서 가장 중요한 키워드 3-5개를 자동으로 뽑아낼 때 사용한다. 
  3. 문서 유사도 계산 : 두 문서가 얼마나 비슷한 주제를 다루고 있는지 비교할 때, 각 문서의 TF-IDF 벡터를 비교한다. 
728x90

4. 비교 : BoW vs TF-IDF

비교 항목 Bag of Words(BoW) TF-IDF
평가 기준 단순히 단어가 등장한 횟수(빈도)만 고려 단어의 빈도+단어의 희귀성을 함께 고
흔한 단어 처리 '나는', '그리고' 등 흔한 단어가 높은 점수를 받음 흔한 단어는 IDF에 의해 점수가 깎임(패널티 부여)
중요도 파악 문서의 진짜 핵심 키워드를 찾기 어려움 문서의 고유한 핵심 키워드를 아주 잘 찾아냄
장점 계산이 매우 빠르고 직관적임 정보 검색과 키워드 추출에 훨씬 정확함

 

 

마무리

TF-IDF는 단순히 많이 나오는 단어에 속하지 않고, 이 문서에만 특별히 자주 등장하는 진짜 핵심 단어를 찾아내는 아주 똑똑한 수학적 필터이다. 

최신 챗GPT 같은 대형 언어 모델(LLM)들은 더 복잡한 임베딩 방식을 사용하지만, 검색 엔진의 원리나 데이터 분석의 기초를 이해하기 위해서는 TF-IDF 의 개념을 반드시 알고 있어야 한다. 

 

 

제미나이, 챗지피티 등을 이용 하여 작성

728x90
반응형

+ Recent posts