텍스트 분석 실험 만들기

AutoAI's 의 텍스트 분석 기능을 사용하여 실험에 대한 텍스트 분석을 수행하세요. 예를 들어, 텍스트 댓글을 바탕으로 결과를 예측하기 위해 기본적인 감정 분석을 수행합니다.

참고: 텍스트 분석 기능은 ‘ AutoAI ’ 분류 및 회귀 실험에서만 사용할 수 있습니다. 이 기능은 시계열 실험에서는 사용할 수 없습니다.

텍스트 분석 개요

텍스트 분석 기능을 사용하는 실험을 생성하면, ‘ AutoAI ’ 프로세스는 알고리즘을 word2vec 사용하여 텍스트를 벡터로 변환한 다음, 이 벡터들을 비교하여 예측 열에 미치는 영향을 파악합니다.

word2vec 알고리즘은 텍스트 코퍼스를 입력으로 받아 벡터 집합을 출력합니다. 텍스트를 숫자로 변환함으로써, 유사한 단어를 식별하고 비교할 수 있습니다. 충분한 데이터로 학습되면, 단어의 의미나 다른 단어들과의 word2vec 관계를 정확하게 예측할 수 있습니다. 이러한 예측 결과는 텍스트 분석 및 감정 분석 애플리케이션에서 의미를 추론하는 데 활용될 수 있습니다.

실험 훈련의 특징 공학 단계에서, 해당 word2vec 알고리즘을 사용하여 텍스트 열에 대해 20개의 특징이 생성됩니다. 텍스트 특징의 자동 감지는 열 내 고유 값의 수와 레코드당 토큰 수(최소 3개)를 분석하는 것을 기반으로 합니다. 고유 값의 개수가 전체 값의 개수를 5로 나눈 수보다 적다면, 해당 열은 텍스트로 처리되지 않습니다.

실험이 완료되면 파이프라인 상세 정보 페이지에서 피처 엔지니어링 결과를 확인할 수 있습니다. 파이프라인을 노트북으로 저장할 수도 있으며, 노트북에서는 변환 과정을 검토하고 변환 결과를 시각화하여 확인할 수 있습니다.

참고: 실험을 검토할 때, 자동 감지 기능으로 텍스트 열이 감지 및 처리되지 않았다고 판단되면 실험 설정에서 해당 텍스트 열을 수동으로 지정할 수 있습니다.

예시: 고객 의견 분석

이 예시에서는 가상의 렌터카 회사에 대한 리뷰를 활용해, 새로운 리뷰가 등록될 때 만족도 점수를 예측하는 모델을 학습시킵니다.

이 짧은 동영상을 통해 예시를 확인하신 후, 동영상 하단에 있는 텍스트 기능에 대한 자세한 내용을 읽어보세요.

이 동영상은 이 문서에 소개된 개념과 작업들을 시각적으로 익힐 수 있는 방법을 제공합니다.

대여 경험에 대한 리뷰 댓글이 포함된 열(Customer_service)과, 0은 부정적 댓글을, 1은 긍정적 댓글을 나타내는 이진 만족도 평가가 포함된 열(Satisfaction)을 가진 데이터 세트를 바탕으로, 새로운 피드백이 입력될 때 만족도 평가를 예측하도록 모델을 학습시킵니다.

텍스트 변환 실험 훈련

데이터 세트를 불러오고 예측 변수(Satisfaction)를 지정하면, 실험 설정 에서 ‘텍스트 특징 공학 사용’ 옵션이 선택됩니다.

텍스트 특징 공학에 사용할 데이터 소스 설정

텍스트 분석 실험을 조정할 때 유의해야 할 몇 가지 세부 사항을 확인해 보세요:

  • 텍스트 열을 자동으로 선택하는 기본 설정을 그대로 사용할 수도 있고, 텍스트 특징 공학을 위해 열을 수동으로 지정하여 더 세밀하게 제어할 수도 있습니다.
  • 실험이 진행되는 동안, 알고리즘을 word2vec 사용하여 텍스트 열에 대해 기본적으로 20개의 특징이 생성됩니다. 해당 값을 수정하여 피처의 수를 늘리거나 줄일 수 있습니다. 벡터를 많이 생성할수록 모델의 정확도는 높아지지만, 훈련 시간은 더 오래 걸립니다.
  • 나머지 옵션들은 모든 유형의 실험에 적용되므로, 최종 훈련 데이터를 처리하는 방식을 세부적으로 조정할 수 있습니다.

실험을 실행하여 진행 중인 변환 과정을 확인해 보세요.

알고리즘 파이프라인 순위표

파이프라인 이름을 선택한 다음, ‘기능 요약’을 클릭하여 텍스트 변환 내용을 확인하세요.

개별 파이프라인의 기능 요약

또한 실험 파이프라인을 노트북으로 저장하고, 변환 과정을 시각화하여 확인할 수 있습니다.

텍스트 변환 모델 배포 및 평가

이 모델을 평가할 때, 새로운 댓글을 입력하면 해당 댓글이 긍정적 또는 부정적 만족도 평가로 이어질지 여부에 대한 신뢰도 점수가 포함된 예측 결과를 확인할 수 있습니다.

예를 들어, “차를 구하는 데 거의 3시간이 걸렸다”라는 댓글을 남기는 경우. “말도 안 되는 일이었다”는 문장에 대해 95%의 신뢰도로 만족도 0점을 예측합니다.

만족도 점수 예측

다음 단계

시계열 예측 실험 구축하기