5명이면 충분할까? 사용성 테스트 참가자 수의 진짜 답
사용성 테스트 참가자 수, 몇 명이 적당할까요? 5명이면 문제의 약 85%가 드러납니다. 다만 더 필요할 때도 있습니다. 연구 근거와 함께 정리했습니다.
2026년 6월 19일 발행

디자이너는 5명이면 충분하다고 하고, 팀장님은 20명은 해야 한다고 합니다. 둘 중 한 사람은 지금 헛수고를 하고 있는 셈인데, 누구일까요?
사용성 테스트는 보통 비슷한 사용자 그룹에게 실제 과제를 주고 어디서 막히는지 옆에서 지켜보는 방식으로 진행합니다. 이런 경우라면 5명만 봐도 문제의 85%쯤이 드러납니다. 야콥 닐슨(Jakob Nielsen)과 톰 랜다우어(Tom Landauer)의 연구에서 나온 숫자라, "5명이면 된다"가 정설처럼 굳어졌죠.
‘5명’이라는 숫자는 어디서 나왔을까
닐슨과 랜다우어는 1993년에, 참가자를 한 명씩 늘릴 때마다 새로운 문제가 얼마나 더 발견되는지를 수학적으로 계산했습니다. 사용자 한 명은 전체 문제의 일부, 평균 31%쯤을 찾아냅니다. 하지만 그다음 사람이 찾는 문제는 앞사람이 찾은 것과 상당 부분 겹치죠. 이걸 식(1 − (1 − 0.31)ⁿ)으로 계산해 보면 곡선이 처음엔 가파르게 오르다가 점점 평평해집니다.
| 참가자 수 | 발견되는 문제(평균) |
|---|---|
| 1명 | ~31% |
| 3명 | ~67% |
| 5명 | ~85% |
| 10명 | ~98% |
| 15명 | ~99% |
처음 몇 명이 대부분의 문제를 찾아냅니다. 다섯 번째쯤 되면 대부분 앞에서 본 문제를 다시 만나게 되죠. 여섯 번째, 일곱 번째부터는 시간과 노력이 첫 사람만큼 드는데도 새로 배우는 건 훨씬 적습니다. 이게 수확 체감입니다.
그래서 보통은 5명이면 충분하다고 알려졌지만, 그 85%라는 숫자는 어디까지나 평균이라 함정이 하나 있습니다. 비슷한 사용자 그룹에게서 정성적인 문제를 찾을 때에만 해당하는 이야기거든요. 목표가 달라지면 필요한 인원도 달라집니다. 숫자로 딱 떨어지게 재거나, 두 디자인을 견주거나, 성격이 아주 다른 사용자 그룹을 다룬다면 5명으로는 부족할 수 있습니다. 애초에 진짜 규칙은 ‘5명’이 아닙니다. 조금 해 보고, 고치고, 다시 해 보는 것이 핵심입니다.
진짜 규칙은 ‘테스트 → 수정 → 반복’
‘5명’이라는 말에 가려진 게 하나 있습니다. 닐슨이 정말 하려던 말은 작게, 자주 하라는 것이었거든요.
15명을 한 번에 부르는 것보다 5명씩 세 번에 나눠 테스트하는 편이 훨씬 낫습니다. 첫 5명에서 찾은 걸 고치면 제품이 바뀌고, 그래야 처음엔 가려져 있던 문제가 새로 드러납니다. 디자인을 그대로 둔 채 15명을 한꺼번에 부르면 똑같은 상위 문제만 계속 다시 만날 뿐이죠. 고치고 다시 해 봐야 다음 층의 문제가 보이지, 멈춰 있는 디자인에 사람만 보태서는 아무것도 바뀌지 않습니다.
그런데 ‘어떤’ 5명인지도 중요합니다
여기서 솔직히 짚고 갈 것이 있습니다. "5명이 85%를 찾는다"는 평균입니다. 평균은 한눈에 들어오는 대신, 그 안에서 값이 얼마나 들쭉날쭉한지는 가려 버리죠.
2003년에 로라 포크너(Laura Faulkner)는 한 제품을 60명에게 테스트한 다음, 그 안에서 5명씩 무작위로 묶어 결과를 다시 계산해 봤습니다. 운 좋게 묶인 5명은 문제의 99%를 찾았습니다. 반면 운 나쁘게 묶인 5명은 55%에 그쳤죠. 같은 제품, 같은 테스트인데 어떤 다섯 명이냐에 따라 결과가 갈린 겁니다.
사람을 늘리면 이 최저치가 올라갑니다.
| 그룹 크기 | 최악의 경우 발견되는 문제(Faulkner, 2003) |
|---|---|
| 5명 | 최소 55% |
| 10명 | 최소 80% |
| 20명 | 최소 95% |
그래서 문제를 놓쳤을 때 타격이 큰 화면, 이를테면 결제 흐름이나 보험 가입 양식이라면, 게다가 여러 번 돌릴 여유가 없다면 5명보다는 8~10명 정도를 테스트하는 편이 안전합니다. 운 나쁜 조합에 걸릴 위험을 미리 덜어 두는 것이죠.
참가자 5명으로 모자란 경우
5명 규칙은 어디까지나 ‘비슷한 사용자 그룹에서 정성적 문제를 찾을 때’ 이야기입니다. 거기서 벗어나는 목적이라면 필요한 숫자가 올라갑니다.
| 목표 | 인원 | 이유 |
|---|---|---|
| 정성적 문제 찾기 | 그룹당 5명, 반복 | 5명 넘으면 수확 체감 |
| 숫자로 재기(과제 시간·성공률·사용성 점수) | 최소 20명, 촘촘히는 40명쯤 | 통계가 받쳐 주려면 표본이 충분해야 함. NN/g는 신뢰도 95%·오차 15%에 40명쯤 권장 |
| 성격이 다른 사용자 그룹(관리자 vs 일반) | 그룹당 3~5명 | 그룹마다 걸리는 문제가 다름 |
| 카드 소팅(정보 구조) | 15명쯤 | 분류 일치도가 15명 부근에서 안정 |
| 아이트래킹 히트맵 | 39명쯤 | 안정적 히트맵엔 양질 데이터 30명, 녹화 실패분 버퍼까지 |
정리하면 이렇습니다. ‘왜’를 묻는 정성 조사는 상대적으로 몇 명이면 됩니다. 반대로 ‘얼마나’를 재는 정량 조사는 통계적인 힘이 필요해서 사람이 훨씬 많이 듭니다. 많은 팀이 이 둘을 헷갈려서, 가벼운 정성 테스트에 사람을 과하게 부르거나, 정작 믿고 쓸 숫자에는 너무 적게 부릅니다.
그래서 몇 명이 필요하냐면
목표별로 나눠 보면 간단해집니다.
- 한 사용자 그룹에서 문제 찾기? 5명으로 시작하고, 고친 다음 또 5명.
- 성격이 다른 두세 그룹이 있다? 그룹마다 3~5명씩.
- 한 번뿐인데 위험 부담이 큰 흐름이다? 운 나쁜 경우까지 대비해서 8~10명.
- 보고하거나 비교할 숫자가 필요하다? 20~40명은 잡으세요.
대부분 ‘작게, 여러 번’으로 수렴한다는 걸 눈치채셨을 텐데요. 문제는 그렇게 자주 하기가 막상 쉽지 않다는 점입니다. 한 번 테스트하면 노트도 쌓이고 녹음도 남는데, 그걸 일일이 분류하고 취합해서 리포트로 정리하는 데 생각보다 시간이 많이 듭니다. 그 정리가 부담스러워서 다음 라운드를 자꾸 미루게 되고, 그러다 반복이 흐지부지되죠.
세션이 끝나는 순간 그 라운드의 발견이 정리돼 있어야 ‘테스트 → 수정 → 반복’이 비로소 현실이 됩니다. Interbang의 가치가 드러나는 지점이 여기입니다. 작성한 노트가 참가자가 그 순간 말한 내용과 연결돼 있고, 성공률 같은 측정치는 세션이 끝나면 이미 집계돼 있거든요.
외워야 할 숫자는 5가 아닙니다. 뭔가 배울 만큼은 크고, 부담 없이 또 할 만큼은 작은 수입니다. 그 반복을 가볍게 이어 가는 데 어떤 도구가 맞는지는 따로 정리해 뒀습니다. 하는 일에 맞춰 고르는 법으로요.
자주 묻는 질문
사용성 테스트에 5명이면 되나요? 비슷한 사용자 그룹에서 정성적 문제를 찾는 거라면 대개 충분합니다. 5명이면 문제의 85%쯤이 드러나고, 여섯 번째 참가자를 부르는 것보다 찾은 문제를 고치고 다시 해 보는 쪽이 배우는 게 많습니다. 다만 통계가 필요하거나, 성격이 아주 다른 사용자 그룹을 함께 다루거나, 문제 하나 놓쳤을 때 타격이 크다면 5명으로는 부족합니다.
5명한테서 나온 성공률, 믿어도 되나요? 방향을 가늠하는 데는 좋습니다. 5명만 봐도 ‘5명 중 4명 성공’ 같은 성공률이 나오니까요. 사용성 테스트는 ‘왜’를 찾는 정성 조사가 중심이고, 이런 수치는 그걸 보완하는 보조 신호입니다. 다만 그 숫자를 통계적으로 단정하거나 두 디자인을 수치로 비교하기엔 표본이 작습니다. 그렇게 믿고 쓸 숫자가 필요하면 적어도 20명, 촘촘히는 40명쯤 잡으세요(NN/g 권장).
사용자 유형이 많이 다르면요? 5명을 한 묶음으로 보지 말고, 뚜렷이 다른 그룹마다 3~5명씩 보세요. 관리자와 일반 사용자, 파는 쪽과 사는 쪽, 초보와 숙련자는 막히는 데가 제각각이라, 섞어서 5명만 보면 어느 한 그룹에만 있는 문제를 놓치기 쉽습니다.
5명 한 번이면 충분한가요? 꼭 반복해야 하나요? 사람들이 정말 쓸 만한 제품을 만들고 싶다면 꼭 반복하세요. 사용성 테스트는 제품을 개선하는 가장 저렴하고 빠른 방법 중 하나니까요.

