로또 관련 사이트에서는 "최근 자주 나온 번호", "오래 안 나온 번호" 같은 통계를 흔히 볼 수 있습니다. 이 사이트의 추첨기도 뽑힌 공마다 최근 1년 출현 횟수를 붙여 보여 줍니다. 그렇다면 이런 기록을 참고해 번호를 고르면 당첨에 유리할까요? 이 글에서는 1회부터 최신회까지 실제 당첨번호로 이 질문을 확인해 봅니다.
추첨기에는 기억이 없다
결론부터 말하면, 추첨이 공정하다면 과거 기록은 다음 추첨에 아무 영향을 주지 않습니다. 공기 혼합식 추첨기 안의 공들은 지난주에 무엇이 나왔는지 알지 못합니다. 매 회차는 45개의 공이 모두 들어간 상태에서 새로 시작하고, 각 번호가 당첨번호에 포함될 확률은 매번 6/45로 같습니다. 통계학에서는 이런 관계를 독립이라고 부릅니다.
그런데도 사람은 두 방향으로 착각하기 쉽습니다.
- "오래 안 나왔으니 이제 나올 차례다." 룰렛에서 검은색이 여러 번 연속으로 나오면 다음엔 빨간색이 나올 것 같은 느낌이 이것입니다. 도박사의 오류라고 부르며, 실제로 공이 "차례"를 기억하는 장치는 없습니다.
- "요즘 잘 나오는 번호는 계속 잘 나온다." 추첨 장비에 물리적인 결함이 있다면 그럴 수도 있습니다. 그래서 확인할 가치가 있습니다. 실제 기록이 이런 쏠림을 보여 주는지, 아래에서 데이터로 따져 보겠습니다.
번호별 출현 횟수는 얼마나 차이 날까
1회부터 최신회까지 -번의 추첨에서 나온 당첨번호(보너스 제외)는 모두 -개입니다. 번호가 45개이므로, 모든 번호의 확률이 같다면 번호당 기대 출현 횟수는 -회입니다.
실제로는 가장 많이 나온 번호가 -번(-회), 가장 적게 나온 번호가 -번(-회)입니다. 차이가 -회나 되니 꽤 커 보입니다. 하지만 이 정도 차이는 우연만으로도 충분히 생깁니다.
각 번호의 출현 횟수는 동전 던지기처럼 "매 회차 6/45 확률로 나오는" 시행을 여러 번 반복한 결과입니다. 이런 횟수는 평균을 중심으로 흩어지고, 그 폭은 표준편차로 잴 수 있습니다. 지금 데이터에서 표준편차는 약 -회이고, 우연만으로도 번호 대부분(약 95%)이 평균 ± 표준편차 2배, 곧 -회 사이에 들어옵니다. 실제로 이 범위를 벗어난 번호는 45개 중 -개입니다. 우연이라면 평균 2개쯤 벗어나는 것이 정상입니다.
우연만으로도 이만큼 차이 난다: 가상 추첨 실험
"우연으로도 그 정도는 난다"는 말을 직접 확인해 볼 수 있습니다. 아래 버튼을 누르면 브라우저가 실제와 같은 횟수(-회)만큼 완전히 공정한 가상 추첨을 200세트 실행합니다. 모든 번호의 확률이 정확히 같은 컴퓨터 추첨에서도 번호별 횟수는 들쭉날쭉합니다. 실제 기록의 최다-최소 차이가 가상 추첨들 사이에서 어느 정도 위치인지 비교해 보세요.
공정한 가상 추첨 200세트와 실제 기록 비교
버튼을 누르면 결과가 여기에 나옵니다. 몇 초 안에 끝납니다.
45개 번호를 한 번에 보는 방법: 카이제곱 검정
번호 하나하나를 따로 보면 45개 중 몇 개는 늘 특이해 보입니다. 그래서 통계학에서는 45개 번호의 편차를 하나의 수로 묶어 평가하는 카이제곱 적합도 검정을 씁니다. 각 번호에 대해 (실제 횟수 − 기대 횟수)² ÷ 기대 횟수를 계산해 모두 더한 값입니다. 모든 번호의 확률이 정말 같다면 이 값이 대략 어느 범위에 있어야 하는지가 수학적으로 정해져 있습니다.
현재 데이터의 검정 결과는 p값 -입니다. p값은 "모든 번호의 확률이 같을 때, 지금만큼 또는 이보다 더 고르지 않은 결과가 나올 확률"입니다. 흔히 0.05보다 작으면 우연으로 보기 어렵다고 판단합니다.
작년에 많이 나온 번호는 다음 해에도 많이 나왔을까
"잘 나오는 번호는 계속 잘 나온다"는 생각을 가장 직접적으로 확인하는 방법이 있습니다. 기록을 1년(52회) 단위로 자르고, 각 해에 가장 많이 나온 번호 10개와 가장 적게 나온 번호 10개가 바로 다음 해에 몇 번 나왔는지 보는 것입니다. 쏠림이 정말 있다면 상위 10개는 다음 해에도 평균보다 많이, 하위 10개는 평균보다 적게 나와야 합니다.
연도 구간별 상위·하위 10개 번호의 다음 해 출현 횟수
한 해에 많이 나왔다는 사실은 다음 해를 예측하는 데 도움이 되지 않았다는 뜻입니다.
그렇다면 통계는 어디에 쓸 수 있나
번호별 통계가 쓸모없다는 뜻은 아닙니다. 쓰임새가 "번호 고르기"가 아닐 뿐입니다.
- 추첨이 공정하게 운영되고 있는지 보는 지표가 됩니다. 20년 넘는 기록에서 번호별 차이가 우연의 범위 안에 있다는 것 자체가 의미 있는 결과입니다. 특정 번호가 오랫동안 크게 벗어난다면 장비를 점검해야 한다는 신호일 수 있습니다.
- 기록을 보는 재미가 있습니다. 어떤 번호가 몇 주째 안 나오고 있는지, 이번 회차에 연속번호가 나왔는지 같은 이야깃거리입니다.
- 확률을 체감하는 교재가 됩니다. 기간을 짧게 잡을수록 편차가 커 보이고, 길게 잡을수록 이론값에 가까워지는 모습(큰 수의 법칙)을 실제 데이터로 볼 수 있습니다.
번호를 고르는 방법 중 수학적으로 의미가 있는 것은 하나뿐입니다. 1~3등 당첨금은 당첨자끼리 나누므로, 많은 사람이 고르는 번호(예: 생일에 쓰이는 1~31)만으로 된 조합은 1등이 되더라도 여러 명이 나눠 가질 가능성이 큽니다. 이것도 당첨 확률을 바꾸지는 않습니다. 어떤 번호가 실제로 인기가 많은지는 공개되지 않아서 정확히 알기도 어렵습니다.
정리
- 추첨은 매 회차 독립입니다. 과거에 많이 나왔든 적게 나왔든 다음 회차에 각 번호가 나올 확률은 6/45로 같습니다.
- 실제 기록에서 번호별 출현 횟수의 차이는 공정한 가상 추첨에서 생기는 차이와 비슷한 수준입니다.
- 한 해에 많이 나온 번호가 다음 해에도 많이 나오는 경향은 기록에서 보이지 않습니다.
데이터와 방법
- 당첨번호: 동행복권 공식 발표 결과, 1회(2002.12.07)부터 최신 회차까지. 매주 자동으로 갱신되며 이 글의 수치도 함께 바뀝니다.
- 가상 추첨은 브라우저의 암호학적 난수(crypto.getRandomValues)로 45개 중 6개를 중복 없이 균등하게 뽑았습니다.
- 연도 구간 분석은 가장 오래된 회차부터 52회씩 겹치지 않게 나눈 구간을 사용했습니다.