본문으로 이동

분류

위키백과, 우리 모두의 백과사전.
다른 뜻에 대해서는 분류 (동음이의) 문서를 참고하십시오.

분류(classification)는 대상을 미리 존재하는 집단이나 범주에 할당하는 활동이다. 이는 집단 자체를 설정하는 작업(예: 클러스터 분석)과는 구별된다.[1] 예를 들어 진단 검사, 스팸 메일 식별, 운전 면허 발급 여부 결정 등이 있다.

'범주'(category)와 마찬가지로 '집단'(class)의 유의어나 유사어로는 '유형'(type), '종'(species), '형태'(forms), '목'(order), '개념'(concept), '분류군'(taxon), '그룹'(group), '식별'(identification), '분할'(division) 등이 있다.

'분류'(classification)라는 단어(및 그 유의어)는 몇 가지 관련된 의미를 지닐 수 있다. '위키백과의 문서를 범주화하는 작업'의 예에서처럼 분류와 집단 생성을 모두 포괄할 수 있으며, 이러한 전반적인 활동은 분류 체계(taxonomy) 항목에 나열되어 있다. 또한, 분류는 집단의 기저 체계(분류 체계라고도 불림)만을 지칭하거나, 분류기가 대상에 부여한 라벨을 의미할 수도 있다.

분류는 다양한 활동의 일부이며 의학, 철학,[2] , 인류학, 생물학, 분류 체계, 인식, 커뮤니케이션, 지식 조직화, 심리학, 통계학, 기계 학습, 수학 등 다양한 관점에서 연구된다. 인간의 의사결정에 대한 경제학적 연구에서는 이를 이산 선택(discrete choice)이라고 부른다.

이항 분류 vs 다중 클래스 분류

[편집]

분류기의 정확도를 높이기 위한 방법론적 연구는 정확히 두 개의 집단이 있는 경우(이항 분류)와 세 개 이상의 집단이 있는 경우(다중 클래스 분류)로 흔히 나뉜다.

정확도 평가

[편집]

결정 이론과 달리 분류는 분류 작업이 반복된다고 가정한다. 또한 복권 (도박)과 달리 각 분류는 옳거나 그를 수 있다고 가정하며, 측정 이론에서 분류는 명목 척도에 대한 측정으로 이해된다. 따라서 분류기의 정확도를 측정하는 것이 가능하다.

분류기의 정확도를 측정하면 두 가지 대안 분류기 중 하나를 선택할 수 있다. 이는 분류기를 개발할 때와 어떤 분류기를 배포할지 결정할 때 모두 중요하다. 그러나 분류기의 정확도를 평가하는 방법은 매우 다양하며 어떤 상황에서 어떤 방법을 사용해야 하는지에 대한 일반적인 방법은 없다. 이항 분류의 경우조차 분야마다 접근 방식이 다르다(이항 분류기의 평가 참조). 패턴 인식에서는 오차율(error rate)이 대중적이다. 신용 평가 업계에서는 지니 계수와 KS 통계량이 널리 사용된다. 역학 및 의학에서는 민감도와 특이도가 널리 쓰이며, 정보 검색에서는 정밀도와 재현율이 널리 사용된다.[3]

분류기의 정확도는 분류 대상 데이터의 특성에 크게 의존한다. 모든 문제에 가장 적합하게 작동하는 단일 분류기는 존재하지 않는다(이는 공짜 점심은 없다 정리로 설명될 수 있는 현상이다).

같이 보기

[편집]

각주

[편집]
  1. The Classification Society | Scientific Classification Organization. 2024년 6월 10일에 원본 문서에서 보존된 문서. 2024년 6월 10일에 확인함.
  2. Classification. Internet Encyclopedia of Philosophy. 2025년 1월 10일에 확인함.
  3. David Hand (2012). Assessing the Performance of Classification Methods. International Statistical Review 80 (3): 400–414. doi:10.1111/j.1751-5823.2012.00183.x.

외부 링크

[편집]
  • 위키미디어 공용에 분류 관련 미디어 분류가 있습니다.