← 전체 글
리서치·7분 읽기

5명이면 충분할까? 사용성 테스트 참가자 수의 진짜 답

사용성 테스트 참가자 수, 몇 명이 적당할까요? 5명이면 문제의 약 85%가 드러납니다. 다만 더 필요할 때도 있습니다. 연구 근거와 함께 정리했습니다.

2026년 6월 19일 발행

똑같은 사용자 아이콘 일곱이 늘어선 줄. 앞 다섯은 또렷하고 다섯 번째만 주황색으로 강조, 뒤 둘은 흐리게 그려서, 약 5명이면 대부분의 사용성 문제가 드러난다는 의미

디자이너는 5명이면 충분하다고 하고, 팀장님은 20명은 해야 한다고 합니다. 둘 중 한 사람은 지금 헛수고를 하고 있는 셈인데, 누구일까요?

사용성 테스트는 보통 비슷한 사용자 그룹에게 실제 과제를 주고 어디서 막히는지 옆에서 지켜보는 방식으로 진행합니다. 이런 경우라면 5명만 봐도 문제의 85%쯤이 드러납니다. 야콥 닐슨(Jakob Nielsen)과 톰 랜다우어(Tom Landauer)의 연구에서 나온 숫자라, "5명이면 된다"가 정설처럼 굳어졌죠.

‘5명’이라는 숫자는 어디서 나왔을까

닐슨과 랜다우어는 1993년에, 참가자를 한 명씩 늘릴 때마다 새로운 문제가 얼마나 더 발견되는지를 수학적으로 계산했습니다. 사용자 한 명은 전체 문제의 일부, 평균 31%쯤을 찾아냅니다. 하지만 그다음 사람이 찾는 문제는 앞사람이 찾은 것과 상당 부분 겹치죠. 이걸 식(1 − (1 − 0.31)ⁿ)으로 계산해 보면 곡선이 처음엔 가파르게 오르다가 점점 평평해집니다.

참가자 수가 1명에서 15명으로 늘어날 때 누적으로 발견되는 사용성 문제 비율을 그린 라인 차트. 곡선은 처음에 가파르게 오른다(1명 약 31%, 3명 약 67%). 그러다 5명 지점(주황 점, 약 85%)을 지나면서 급격히 평평해지고, 6명부터는 선이 거의 수평이라 사람을 더 붙여도 새 문제가 거의 나오지 않는다.

참가자 수발견되는 문제(평균)
1명~31%
3명~67%
5명~85%
10명~98%
15명~99%

처음 몇 명이 대부분의 문제를 찾아냅니다. 다섯 번째쯤 되면 대부분 앞에서 본 문제를 다시 만나게 되죠. 여섯 번째, 일곱 번째부터는 시간과 노력이 첫 사람만큼 드는데도 새로 배우는 건 훨씬 적습니다. 이게 수확 체감입니다.

그래서 보통은 5명이면 충분하다고 알려졌지만, 그 85%라는 숫자는 어디까지나 평균이라 함정이 하나 있습니다. 비슷한 사용자 그룹에게서 정성적인 문제를 찾을 때에만 해당하는 이야기거든요. 목표가 달라지면 필요한 인원도 달라집니다. 숫자로 딱 떨어지게 재거나, 두 디자인을 견주거나, 성격이 아주 다른 사용자 그룹을 다룬다면 5명으로는 부족할 수 있습니다. 애초에 진짜 규칙은 ‘5명’이 아닙니다. 조금 해 보고, 고치고, 다시 해 보는 것이 핵심입니다.

진짜 규칙은 ‘테스트 → 수정 → 반복’

‘5명’이라는 말에 가려진 게 하나 있습니다. 닐슨이 정말 하려던 말은 작게, 자주 하라는 것이었거든요.

15명을 한 번에 부르는 것보다 5명씩 세 번에 나눠 테스트하는 편이 훨씬 낫습니다. 첫 5명에서 찾은 걸 고치면 제품이 바뀌고, 그래야 처음엔 가려져 있던 문제가 새로 드러납니다. 디자인을 그대로 둔 채 15명을 한꺼번에 부르면 똑같은 상위 문제만 계속 다시 만날 뿐이죠. 고치고 다시 해 봐야 다음 층의 문제가 보이지, 멈춰 있는 디자인에 사람만 보태서는 아무것도 바뀌지 않습니다.

그런데 ‘어떤’ 5명인지도 중요합니다

여기서 솔직히 짚고 갈 것이 있습니다. "5명이 85%를 찾는다"는 평균입니다. 평균은 한눈에 들어오는 대신, 그 안에서 값이 얼마나 들쭉날쭉한지는 가려 버리죠.

2003년에 로라 포크너(Laura Faulkner)는 한 제품을 60명에게 테스트한 다음, 그 안에서 5명씩 무작위로 묶어 결과를 다시 계산해 봤습니다. 운 좋게 묶인 5명은 문제의 99%를 찾았습니다. 반면 운 나쁘게 묶인 5명은 55%에 그쳤죠. 같은 제품, 같은 테스트인데 어떤 다섯 명이냐에 따라 결과가 갈린 겁니다.

사람을 늘리면 이 최저치가 올라갑니다.

그룹 크기최악의 경우 발견되는 문제(Faulkner, 2003)
5명최소 55%
10명최소 80%
20명최소 95%

그래서 문제를 놓쳤을 때 타격이 큰 화면, 이를테면 결제 흐름이나 보험 가입 양식이라면, 게다가 여러 번 돌릴 여유가 없다면 5명보다는 8~10명 정도를 테스트하는 편이 안전합니다. 운 나쁜 조합에 걸릴 위험을 미리 덜어 두는 것이죠.

참가자 5명으로 모자란 경우

5명 규칙은 어디까지나 ‘비슷한 사용자 그룹에서 정성적 문제를 찾을 때’ 이야기입니다. 거기서 벗어나는 목적이라면 필요한 숫자가 올라갑니다.

목표인원이유
정성적 문제 찾기그룹당 5명, 반복5명 넘으면 수확 체감
숫자로 재기(과제 시간·성공률·사용성 점수)최소 20명, 촘촘히는 40명쯤통계가 받쳐 주려면 표본이 충분해야 함. NN/g는 신뢰도 95%·오차 15%에 40명쯤 권장
성격이 다른 사용자 그룹(관리자 vs 일반)그룹당 3~5명그룹마다 걸리는 문제가 다름
카드 소팅(정보 구조)15명쯤분류 일치도가 15명 부근에서 안정
아이트래킹 히트맵39명쯤안정적 히트맵엔 양질 데이터 30명, 녹화 실패분 버퍼까지

정리하면 이렇습니다. ‘왜’를 묻는 정성 조사는 상대적으로 몇 명이면 됩니다. 반대로 ‘얼마나’를 재는 정량 조사는 통계적인 힘이 필요해서 사람이 훨씬 많이 듭니다. 많은 팀이 이 둘을 헷갈려서, 가벼운 정성 테스트에 사람을 과하게 부르거나, 정작 믿고 쓸 숫자에는 너무 적게 부릅니다.

그래서 몇 명이 필요하냐면

목표별로 나눠 보면 간단해집니다.

  • 한 사용자 그룹에서 문제 찾기? 5명으로 시작하고, 고친 다음 또 5명.
  • 성격이 다른 두세 그룹이 있다? 그룹마다 3~5명씩.
  • 한 번뿐인데 위험 부담이 큰 흐름이다? 운 나쁜 경우까지 대비해서 8~10명.
  • 보고하거나 비교할 숫자가 필요하다? 20~40명은 잡으세요.

대부분 ‘작게, 여러 번’으로 수렴한다는 걸 눈치채셨을 텐데요. 문제는 그렇게 자주 하기가 막상 쉽지 않다는 점입니다. 한 번 테스트하면 노트도 쌓이고 녹음도 남는데, 그걸 일일이 분류하고 취합해서 리포트로 정리하는 데 생각보다 시간이 많이 듭니다. 그 정리가 부담스러워서 다음 라운드를 자꾸 미루게 되고, 그러다 반복이 흐지부지되죠.

세션이 끝나는 순간 그 라운드의 발견이 정리돼 있어야 ‘테스트 → 수정 → 반복’이 비로소 현실이 됩니다. Interbang의 가치가 드러나는 지점이 여기입니다. 작성한 노트가 참가자가 그 순간 말한 내용과 연결돼 있고, 성공률 같은 측정치는 세션이 끝나면 이미 집계돼 있거든요.

외워야 할 숫자는 5가 아닙니다. 뭔가 배울 만큼은 크고, 부담 없이 또 할 만큼은 작은 수입니다. 그 반복을 가볍게 이어 가는 데 어떤 도구가 맞는지는 따로 정리해 뒀습니다. 하는 일에 맞춰 고르는 법으로요.

자주 묻는 질문

사용성 테스트에 5명이면 되나요? 비슷한 사용자 그룹에서 정성적 문제를 찾는 거라면 대개 충분합니다. 5명이면 문제의 85%쯤이 드러나고, 여섯 번째 참가자를 부르는 것보다 찾은 문제를 고치고 다시 해 보는 쪽이 배우는 게 많습니다. 다만 통계가 필요하거나, 성격이 아주 다른 사용자 그룹을 함께 다루거나, 문제 하나 놓쳤을 때 타격이 크다면 5명으로는 부족합니다.

5명한테서 나온 성공률, 믿어도 되나요? 방향을 가늠하는 데는 좋습니다. 5명만 봐도 ‘5명 중 4명 성공’ 같은 성공률이 나오니까요. 사용성 테스트는 ‘왜’를 찾는 정성 조사가 중심이고, 이런 수치는 그걸 보완하는 보조 신호입니다. 다만 그 숫자를 통계적으로 단정하거나 두 디자인을 수치로 비교하기엔 표본이 작습니다. 그렇게 믿고 쓸 숫자가 필요하면 적어도 20명, 촘촘히는 40명쯤 잡으세요(NN/g 권장).

사용자 유형이 많이 다르면요? 5명을 한 묶음으로 보지 말고, 뚜렷이 다른 그룹마다 3~5명씩 보세요. 관리자와 일반 사용자, 파는 쪽과 사는 쪽, 초보와 숙련자는 막히는 데가 제각각이라, 섞어서 5명만 보면 어느 한 그룹에만 있는 문제를 놓치기 쉽습니다.

5명 한 번이면 충분한가요? 꼭 반복해야 하나요? 사람들이 정말 쓸 만한 제품을 만들고 싶다면 꼭 반복하세요. 사용성 테스트는 제품을 개선하는 가장 저렴하고 빠른 방법 중 하나니까요.

이어서 읽기