EdTech AI를 PoC가 아니라 실서비스 검증으로 이동

조회 250좋아요 0

새로운 AI 수학 선생님을 만들었다고 생각해 봅시다. 개발자가 미리 준비한 문제를 입력하자 AI가 빠르게 답하고, 예쁜 그림까지 보여 줍니다. 발표를 보던 사람들은 박수를 칩니다. 이것이 PoC(개념검증)입니다. “이 아이디어를 기술로 만들 수 있는가?”라는 질문에는 답했지만, 아직 “학생에게 실제로 도움이 되는가?”에는 답하지 못했습니다.

진짜 교실에 들어가면 상황이 달라집니다. 학생은 문제를 짧게 쓰기도 하고 오타를 내기도 합니다. 답만 베끼려는 학생도 있고, 긴 설명을 읽기 어려운 학생도 있습니다. 교사는 수업 중 서른 명을 돌봐야 하므로 복잡한 설정을 매번 할 수 없습니다. 학교 인터넷이 느릴 수도 있고, AI가 그럴듯한 오답을 말하거나 학생의 개인정보를 필요 이상으로 모을 수도 있습니다.

그래서 앞으로의 차별점은 AI 교육 플랫폼을 하나 더 만드는 데만 있지 않습니다. 이미 만들어진 제품을 실제 사용자에게 안전하게 적용하고, 무엇이 좋아졌으며 무엇이 위험했는지 증명하고, 그 결과를 학교·교육청·대학이 도입 판단에 사용할 수 있게 만드는 EdTech Validation Platform, 즉 에듀테크 실서비스 검증 플랫폼에 더 큰 기회가 있습니다.

이 글은 거창한 연구 용어부터 외우게 하지 않습니다. PoC 다음 단계에서 사용자 Evidence, 곧 실제 사용자가 남긴 믿을 만한 증거를 어떻게 만드는지 수학 AI 튜터 사례로 차근차근 설명합니다.

실험실의 EdTech AI PoC가 실제 교실 사용과 기관의 근거 기반 도입 판단으로 이어지는 모습

PoC가 보여 주는 것과 보여 주지 못하는 것

PoC는 꼭 필요합니다. 말로만 가능한 아이디어인지, 정말 작동하는 아이디어인지 빠르게 확인할 수 있기 때문입니다. 음성을 알아듣는지, 학생 수준에 맞춰 문제를 만드는지, 학교의 학습관리시스템과 연결할 수 있는지 먼저 시험해 볼 수 있습니다. 실패해도 작은 비용으로 고칠 수 있다는 장점도 있습니다.

하지만 PoC의 무대는 대개 잘 정리되어 있습니다. 개발팀이 아는 기기와 네트워크를 쓰고, 성공하기 쉬운 질문을 고르며, 짧은 시간 동안 몇 명이 사용합니다. 이 결과를 곧바로 “학습 효과가 있다”라고 부르면 급식실에서 음식 한 숟갈을 맛본 뒤 “전교생이 한 학기 동안 건강해졌다”라고 말하는 것과 비슷합니다.

다음 네 단계는 서로 다른 질문에 답합니다.

단계 확인하는 질문 대표 결과
PoC 기술적으로 만들 수 있는가? 핵심 기능 시연, 연동 가능성
파일럿 실제 사용자가 쓸 수 있는가? 사용 성공률, 오류, 교사·학생 의견
실서비스 검증 일정 기간 사용했을 때 도움이 되고 안전한가? 학습 변화, 사용 지속, 사고와 편향, 운영 부담
기관 도입 우리 학교가 책임지고 계속 운영할 수 있는가? 비용, 계약, 보안, 지원, 접근성, 확장 계획

파일럿에서 학생들이 “재미있어요”라고 답한 것은 좋은 신호입니다. 그러나 만족도가 높다는 사실과 학습 성취가 높아졌다는 사실은 다릅니다. 로그인 횟수가 늘었다고 해서 공부를 더 잘하게 되었다는 뜻도 아닙니다. 반대로 시험 점수가 조금 올랐더라도, 원래 공부를 잘하던 학생만 끝까지 남았다면 제품의 효과라고 단정하기 어렵습니다.

미국 교육부 산하 What Works Clearinghouse는 교육 프로그램의 효과를 판단할 때 연구 설계, 비교 조건, 중도 이탈, 표본과 현장의 관련성을 함께 봅니다. 강한 증거일수록 단순한 전후 비교보다 잘 설계된 무작위 비교 연구에 가까워집니다. 모든 초기 제품이 처음부터 큰 연구를 할 필요는 없지만, 현재 가진 증거의 세기를 정직하게 표시하는 습관은 처음부터 필요합니다.

사용자 Evidence는 후기 모음이 아니다

Evidence를 “사용자 후기”라고만 번역하면 중요한 부분을 놓칩니다. “좋았어요”라는 한 문장도 자료이지만, 어느 학생이 어떤 환경에서 얼마나 사용했고 무엇이 달라졌는지 알 수 없으면 기관의 구매 결정을 받치기 어렵습니다.

사용자 Evidence에는 적어도 네 종류가 함께 있어야 합니다.

첫째는 사용 증거입니다. 학생이 가입했는지보다 실제 학습 과제를 끝냈는지, 어디에서 멈췄는지, 교사가 수업 준비에 몇 분을 썼는지 봅니다. 클릭 수를 많이 만드는 것이 목표가 아니라, 수업 흐름 속에서 제품이 제대로 사용됐는지를 확인하는 자료입니다.

둘째는 학습 증거입니다. 사용 전과 사용 후에 같은 능력을 공정하게 재고, 가능하면 기존 수업을 받은 비슷한 집단과 비교합니다. AI가 연습시킨 문제를 그대로 시험에 내면 당연히 AI 사용 집단이 유리합니다. 따라서 배운 원리를 새로운 문제에도 적용할 수 있는지 확인해야 합니다.

셋째는 경험 증거입니다. 점수만으로는 “왜”를 알기 어렵습니다. 학생 인터뷰, 교사 관찰, 도움 요청 기록을 함께 보면 글자가 너무 작았는지, 설명이 길었는지, AI 답을 믿지 못했는지 알 수 있습니다. 숫자와 사람의 이야기를 함께 쓰는 이유입니다.

넷째는 안전·공정성 증거입니다. 틀린 답, 위험하거나 나이에 맞지 않는 답, 개인정보 노출, 특정 학생 집단에서 더 잦은 오류, 접근성 실패를 기록합니다. 사고가 신고되지 않았다는 사실만으로 안전하다고 말할 수는 없습니다. 발견하기 위한 시험을 했는지, 신고 통로가 쉬웠는지까지 확인해야 합니다.

PoC에서 사용자 Evidence로 가는 구체적인 방법

1단계: 제품이 증명하려는 문장을 하나로 줄인다

“AI로 교육을 혁신한다”는 문장은 측정할 수 없습니다. 대신 다음처럼 씁니다.

초등학교 5학년 학생이 8주 동안 주 3회 이 수학 튜터를 사용하면, 기존 보충학습과 비교해 분수 문장제 풀이 능력이 좋아지고 교사의 개별 피드백 시간이 줄어드는가?

이 한 문장에는 대상, 기간, 사용 빈도, 비교 대상, 학생 결과, 교사 결과가 들어 있습니다. 실증 도중 멋있어 보이는 다른 숫자로 목표를 바꾸는 일을 막아 줍니다. AI 튜터가 읽기 능력이나 자신감도 높일 수 있겠지만, 한 번의 작은 실증에서 모든 것을 증명하려 하면 어느 것도 선명하게 설명하기 어렵습니다.

2단계: 시험할 제품 버전과 사용 경계를 얼린다

AI 서비스는 계속 바뀝니다. 실증 첫 주와 마지막 주의 모델이 다르면 무엇을 평가했는지 알 수 없습니다. 모델 이름과 버전, 지식 자료, 안전 필터, 프롬프트, 앱 버전, 주요 설정을 하나의 묶음으로 기록해야 합니다. 꼭 고쳐야 할 심각한 오류가 생기면 변경 전후 날짜와 이유를 남기고, 결과도 나눠서 봅니다.

사용 경계도 정합니다. 예를 들어 “수업 시간에 교사의 감독 아래 분수 문제에만 사용하며, 숙제 답안을 대신 만드는 용도로는 쓰지 않는다”라고 밝힙니다. 제품이 잘하는 범위를 좁게 검증한 뒤 넓히는 편이 안전합니다.

3단계: 진짜 목표 사용자를 모집한다

초등학생용 제품을 개발자와 대학생만 써 보고 검증 완료라고 할 수 없습니다. 실제 대상 학년의 학생, 수업을 운영할 교사, 필요하면 특수교육과 다문화 교육 담당자도 참여해야 합니다. 인터넷 속도와 기기 종류가 다른 학교가 들어오면 결과가 실제 도입 환경에 가까워집니다.

참여자는 편한 사람만 고르지 않습니다. 디지털 기기에 익숙한 학생만 모으면 사용성이 실제보다 좋아 보입니다. 참여하지 않은 이유와 도중에 그만둔 이유도 남깁니다. 사용을 중단한 학생은 실패한 숫자가 아니라, 제품이 누구에게 맞지 않았는지를 알려 주는 중요한 Evidence입니다.

미성년자가 참여하므로 학교 승인, 보호자 안내와 필요한 동의, 수집 정보의 목적과 보관 기간을 먼저 정합니다. 학습에 꼭 필요하지 않은 이름, 주소, 자유 대화 원문은 가능한 한 받지 않거나 가명으로 바꿉니다. 교육부도 학습지원 소프트웨어가 필요한 최소 정보만 처리하고 학생 개인정보를 안전하게 관리하도록 기준과 기업용 보안 지침을 두고 있습니다.

4단계: 사용하기 전의 출발점을 잰다

8주 뒤 점수만 보면 원래 잘하던 학생인지 제품 덕분에 늘었는지 알 수 없습니다. 실증 전에 짧은 분수 평가를 실시해 기준선을 만듭니다. 학습 결과뿐 아니라 학생의 자신감, 교사의 피드백 시간, 현재 사용 중인 보충학습 방식, 기기와 네트워크 상태도 기록할 수 있습니다.

기준선 시험은 AI가 연습시킬 문제와 똑같아서는 안 됩니다. 같은 개념을 묻되 표현과 숫자는 달라야 합니다. 읽기 어려움이 있는 학생에게 시험 문장이 지나치게 복잡하면 수학이 아니라 읽기 능력을 재게 되므로 측정 도구가 대상에게 맞는지도 살펴봅니다.

5단계: 가능한 범위에서 공정한 비교를 만든다

가장 이해하기 쉬운 소규모 안은 네 학급을 모집해 두 학급은 AI 튜터를 사용하고 두 학급은 기존 보충수업을 계속하는 것입니다. 가능하다면 학급을 어느 쪽에 넣을지 무작위로 정합니다. 무작위 배정이 어렵다면 이전 성취도, 학년, 학교 환경이 비슷한 학급을 짝지어 비교합니다.

중요한 점은 AI 사용 집단만 특별히 더 긴 수업을 받지 않게 하는 것입니다. AI 집단이 매주 한 시간 더 공부했다면 점수 차이는 제품보다 추가 학습 시간에서 나왔을 수 있습니다. 교사 연수, 수업 시간, 평가 시점도 가능한 한 비슷하게 맞춥니다.

학급이 하나뿐이라면 포기할 필요는 없습니다. 같은 학생의 사용 전후를 비교하고, 매주 짧은 평가로 변화 방향을 볼 수 있습니다. 다만 그 결과에는 “초기 가능성”이라고 이름을 붙여야 합니다. 작은 전후 비교를 “모든 학교에서 효과가 입증됐다”라고 부르지 않는 것이 증거 플랫폼의 신뢰를 지키는 방법입니다.

6단계: 실제 수업을 방해하지 않는 방식으로 운영한다

연구를 위해 교실을 실험실처럼 만들면 실서비스를 검증한 것이 아닙니다. 교사는 평소 시간표 안에서 제품을 사용하고, 학생도 학교 기기로 로그인하며, 느린 인터넷과 결석 같은 현실을 그대로 겪어야 합니다. 기간은 단순 호기심이 가라앉고 반복 사용의 문제가 드러날 만큼 길어야 합니다. 제품에 따라 다르지만, 예시의 8주는 하루 시연보다 훨씬 많은 것을 보여 줍니다.

플랫폼은 교사에게 매일 긴 보고서를 쓰게 하면 안 됩니다. 수업이 끝난 뒤 “완료”, “부분 완료”, “운영 불가”를 빠르게 선택하고 이유를 한 줄 적게 할 수 있습니다. 사용 시간과 오류는 시스템이 자동 기록하되 학생의 자유 대화 전체를 무조건 저장하지 않습니다. 필요한 증거와 사생활 보호 사이의 균형이 중요합니다.

7단계: 사용·학습·안전 데이터를 같은 시간선에 놓는다

예를 들어 셋째 주에 로그인 성공률이 떨어지고 학습 점수도 함께 내려갔다면, AI 설명의 문제가 아니라 학교 와이파이 장애일 수 있습니다. 반대로 접속은 잘 됐는데 특정 유형의 학생만 도움 요청이 늘었다면 접근성이나 설명 방식의 문제일 수 있습니다.

한 화면에서 다음 관계를 볼 수 있어야 합니다.

관찰 대상 쉬운 측정 예 해석할 때 주의할 점
실제 사용 과제 완료율, 중단 지점, 교사 준비 시간 접속 횟수만으로 학습을 판단하지 않기
학습 변화 기준선 대비 향상, 비교 학급과의 차이 시험이 제품 문제와 지나치게 닮지 않았는지 확인
경험 학생 이해도, 교사 관찰, 인터뷰 만족도를 효과로 바꾸어 말하지 않기
안전 오답, 유해 답변, 개인정보 노출, 신고와 대응 시간 신고 0건을 자동으로 안전 판정하지 않기
공정성·접근성 집단별 오류와 이탈, 화면읽기·자막 사용 전체 평균이 작은 집단의 문제를 숨길 수 있음
운영 장애 시간, 로그인 성공, 지원 요청, 비용 연구팀의 특별 지원을 일반 운영으로 착각하지 않기

UNESCO의 생성형 AI 교육 가이드는 데이터 프라이버시 보호, 나이에 맞는 사용, 인간 중심의 윤리적 검증과 교육적 설계를 강조합니다. NIST AI 위험관리 프레임워크도 사용 맥락을 파악하고 위험을 측정한 뒤 관리하며, 운영 중에도 반복해서 살펴보라고 안내합니다. 교육 효과와 AI 안전은 어느 하나로 다른 하나를 대신할 수 없으므로 두 축을 동시에 기록해야 합니다.

8단계: 결과뿐 아니라 빠진 사람과 한계를 함께 해석한다

가령 AI 사용 학급의 평균 점수가 8점, 비교 학급은 5점 올랐다고 합시다. 곧바로 “AI가 3점의 효과를 냈다”라고 쓰기 전에 몇 가지를 확인해야 합니다. 시작 점수는 비슷했는지, 결석과 중도 이탈은 어느 쪽이 많았는지, 같은 교사가 가르쳤는지, 시험 채점자는 어느 학급인지 알고 있었는지 살펴봅니다.

평균만 보지 말고 기초 점수가 낮은 학생, 읽기 지원이 필요한 학생, 사용하는 언어가 다른 학생에게서 결과가 어땠는지도 봅니다. 전체 평균은 좋아졌지만 일부 학생의 오류율이 크게 늘었다면 그대로 전면 도입할 수 없습니다. 다음 실증에서는 그 집단의 설명과 접근성부터 고쳐야 합니다.

숫자가 좋지 않아도 실증이 실패한 것은 아닙니다. 교사 준비 시간이 너무 길다는 사실, 20분 뒤 학생 집중이 떨어진다는 사실, 특정 질문에서 AI가 같은 오답을 반복한다는 사실은 제품을 개선할 수 있는 값진 Evidence입니다. 검증 플랫폼은 성공 광고를 만드는 곳이 아니라 도입 결정을 더 정확하게 만드는 곳이어야 합니다.

간단한 수학 AI 튜터 실증을 끝까지 따라가 보기

네 개 초등학교에서 5학년 네 학급, 총 100명이 참여한다고 가정해 보겠습니다. 두 학급은 8주 동안 월·수·금 20분씩 AI 튜터를 사용하고, 나머지 두 학급은 같은 시간에 기존 문제집과 교사 피드백을 사용합니다. 두 집단은 시작 전에 서로 다른 문항으로 구성된 같은 난이도의 분수 평가를 봅니다.

AI 튜터는 답을 바로 알려 주지 않고 첫 번째 풀이 단계를 질문하도록 설정합니다. 학생의 이름 대신 실증용 번호를 쓰고, 대화 원문은 안전 사고 조사에 필요한 짧은 기간만 제한적으로 보관합니다. 교사는 수업 뒤 운영 상태와 도움이 필요했던 학생 수를 간단히 기록합니다. 시스템은 과제 완료율, 힌트 사용, 응답 오류, 지연과 장애를 자동 수집합니다.

넷째 주에는 중간 관찰을 합니다. 이때 점수가 조금 낮다고 목표나 학생을 바꾸지 않습니다. 대신 심각한 유해 답변이나 개인정보 문제가 발견되면 즉시 사용을 멈추고 원인을 조사합니다. 안전을 위해 중단한 사건도 숨기지 않고 결과에 포함합니다.

8주 뒤에는 처음과 같은 개념이지만 다른 문제로 다시 평가합니다. 교사에게는 학생별 피드백 준비 시간이 얼마나 변했는지 묻고, 학생 인터뷰에서는 “재미있었니?”뿐 아니라 “틀린 답을 받았을 때 어떻게 했니?”, “설명이 이해되지 않으면 누구에게 도움을 요청했니?”를 묻습니다.

최종 보고서에는 평균 점수 하나만 싣지 않습니다. 참여한 학교와 학생의 범위, 실제 사용량, 중도 이탈, 점수 변화와 불확실성, 교사 시간, 오류와 안전 사고, 집단별 차이, 제품 버전, 연구의 한계를 함께 적습니다. 그러면 다른 학교가 “우리 학교의 기기와 학생 구성에도 이 결과가 비슷하게 적용될까?”를 판단할 수 있습니다.

EdTech Validation Platform은 무엇을 만들어야 하는가

일반 AI 교육 플랫폼의 중심은 콘텐츠와 학습 경험입니다. 문제를 내고, 설명하고, 진도를 추천합니다. Validation Platform의 중심은 검증 과정과 결정 가능한 증거입니다. 직접 학생을 가르치는 서비스와 경쟁하기보다 여러 EdTech 제품을 같은 기본 규칙 아래 시험하도록 돕습니다.

첫 번째 기능은 실증 설계 도구입니다. 제품 회사와 학교가 목표 문장, 대상, 기간, 비교 방식, 성공 기준을 함께 정합니다. 학습 효과가 목표인지, 교사 업무 절감이 목표인지 분리하고 제품 버전도 등록합니다.

두 번째는 참여와 동의 관리입니다. 학생·보호자·교사의 안내와 동의 상태, 가명 식별자, 자료 보관 기간을 관리합니다. 기업에는 필요한 최소 자료만 제공하고, 학교는 누가 어떤 목적으로 접근했는지 확인할 수 있어야 합니다.

세 번째는 중립적인 데이터 연결입니다. 제품 사용 기록, 학교 평가, 교사 관찰, 설문, 안전 신고를 시간선으로 연결합니다. 회사가 자기 제품의 좋은 수치만 골라 내보내는 대신, 미리 정한 자료가 같은 형식으로 들어오게 합니다. 원본과 수정 이력을 구분해 결과의 출처도 추적할 수 있어야 합니다.

네 번째는 효과 분석과 설명입니다. 기준선 차이와 중도 이탈을 표시하고, 비교 집단과의 변화 및 집단별 결과를 보여 줍니다. “통계적으로 유의하다”라는 도장 하나보다 표본이 얼마나 작고 결과가 어느 범위에서 흔들릴 수 있는지 쉬운 말로 설명하는 편이 기관 담당자에게 더 유용합니다.

다섯 번째는 AI 안전 관찰입니다. 유해 출력, 환각, 편향, 개인정보, 무단 기능 사용을 신고하고 심각도와 대응 시간을 기록합니다. 교사는 학생 화면을 적절히 감독할 수 있고, 심각한 문제가 생기면 기능이나 전체 실증을 멈출 수 있어야 합니다. 모델이나 안전 필터가 바뀌면 이전 검증 결과가 어느 버전에 해당하는지도 알려야 합니다.

여섯 번째는 기관 도입용 Evidence Package입니다. 검증이 끝나면 담당자가 다시 자료를 모아 문서를 만들지 않도록 다음 내용이 한 묶음으로 나옵니다.

  • 무엇을 누구에게 어떤 조건에서 시험했는지 보여 주는 실증 개요
  • 제품·모델·데이터·안전 설정의 버전 기록
  • 사용, 학습, 경험, 안전, 접근성, 운영 결과
  • 비교 방법, 중도 이탈, 알려진 한계와 재현 가능한 분석 정보
  • 개인정보 처리, 보안 점검, 장애 대응과 지원 책임
  • 제한 도입, 추가 실증, 전면 도입, 보류 중 어떤 판단이 타당한지에 대한 근거

이 묶음은 합격증이 아닙니다. 한 학교에서 8주 동안 얻은 결과를 모든 지역과 학년에 그대로 적용할 수 없기 때문입니다. 대신 기관이 질문할 수 있는 공통 언어를 만듭니다. 영국 교육부가 2025년 발표한 EdTech impact testbed 구상도 학교와 대학에서 제품의 영향을 시험해 개발과 구매를 위한 증거를 만들고, 현장 시험과 높은 수준의 효과 연구가 서로 다른 깊이의 증거를 제공한다고 설명합니다.

기관 도입은 “효과 있음” 한 줄로 끝나지 않는다

학교가 제품을 산다는 것은 계정을 여는 것보다 큰 일입니다. 기존 로그인과 학습관리시스템에 연결되는지, 느린 기기에서도 작동하는지, 장애 때 수업을 어떻게 계속할지, 교사 연수와 고객지원은 누가 맡을지, 계약이 끝나면 학생 자료를 어떻게 돌려주거나 지울지 결정해야 합니다.

따라서 도입 판단은 네 갈래가 현실적입니다. 근거가 충분하고 위험이 관리되면 범위를 넓힙니다. 효과 신호는 있지만 자료가 약하면 제한된 학년에서 검증을 반복합니다. 특정 학생에게만 도움이 되면 대상과 목적을 좁혀 도입합니다. 심각한 안전 문제나 효과 없음이 확인되면 보류하고 제품을 고칩니다. 모든 제품을 억지로 “통과”시키는 플랫폼은 오래 신뢰받기 어렵습니다.

한국에서도 에듀테크 소프트랩이 학교 수업과 교사 연구회를 기업에 연결해 제품을 현장에서 시험하고 개선 자료를 제공하는 역할을 해 왔습니다. 이 구조가 한 단계 더 발전하려면, 현장 의견뿐 아니라 제품 버전, 기준선, 비교 조건, 안전 사고, 효과와 한계를 표준화된 Evidence Package로 이어 줄 필요가 있습니다.

AI 제품은 한 번 검증하고 끝낼 수 없다

일반 교재는 인쇄한 뒤 내용이 저절로 바뀌지 않습니다. AI 제품은 사용하는 기반 모델, 검색 자료, 프롬프트, 필터가 바뀌면 어제와 다른 답을 할 수 있습니다. 그래서 1년 전의 검증 보고서가 오늘 버전에도 그대로 적용된다고 가정하면 안 됩니다.

작은 화면 색상 변경처럼 결과에 거의 영향을 주지 않는 수정과, 기반 모델 교체처럼 핵심 행동을 바꾸는 수정을 구분해야 합니다. 중요한 변경 뒤에는 대표 학습 과제와 안전 시험을 다시 실행합니다. 운영 중에도 오류율, 집단별 이탈, 유해 답변, 교사 부담이 기준 범위를 벗어나는지 살펴봅니다. 이것이 지속 검증입니다.

검증 플랫폼의 진짜 경쟁력은 화려한 대시보드가 아닙니다. 학교가 믿을 수 있는 방식으로 자료를 모으고, 회사에 불편한 결과도 지우지 않으며, 제품이 바뀌면 오래된 증거에 경고 표시를 붙이는 신뢰 구조입니다. 독립 연구자나 기관이 분석을 다시 확인할 수 있다면 신뢰는 더 커집니다.

Evidence에도 성장 단계가 있다

초기 회사가 첫 실증부터 수백 개 학교를 모집하기는 어렵습니다. 그렇다고 PoC 화면만 들고 기관에 효과가 입증됐다고 말할 필요도 없습니다. 지금 어느 단계에 있는지를 정확히 표시하고 다음 증거로 올라가면 됩니다.

첫 번째 단계는 작동 증거입니다. 핵심 기능이 정해진 조건에서 반복해서 작동하고, 치명적인 오류 없이 과제를 끝낼 수 있음을 보입니다. 이 단계의 결론은 “만들 수 있다”이지 “학습 효과가 있다”가 아닙니다.

두 번째 단계는 사용 가능성 증거입니다. 소수의 실제 학생과 교사가 제품을 사용하며 막히는 지점, 필요한 설명, 수업 준비 부담을 찾습니다. 여기서는 사용자가 제품을 이해하고 목적에 맞게 쓸 수 있는지가 중심입니다.

세 번째 단계는 효과 가능성 증거입니다. 기준선을 재고 일정 기간 운영하며, 비교 집단이나 반복 측정으로 변화가 제품과 관련되어 있는지 살펴봅니다. 표본이 작으면 확정적인 효과보다 “어느 조건에서 가능성이 보였다”라고 설명합니다.

네 번째 단계는 확장 가능한 효과 증거입니다. 여러 학교와 다양한 학생을 대상으로 더 엄격한 비교 연구를 하고, 다른 교사가 운영해도 비슷한 결과가 나오는지 확인합니다. 미국 WWC의 강한 증거 기준처럼 연구 설계와 표본, 여러 현장, 중도 이탈을 엄격하게 보는 단계에 가까워집니다.

다섯 번째 단계는 지속 운영 증거입니다. 계약 뒤에도 실제 사용과 효과가 유지되는지, 비용과 지원 부담이 예상 범위인지, 모델 업데이트 뒤 위험이 다시 생기지 않는지 봅니다. 기관 입장에서는 구매 전의 짧은 성공보다 이 단계가 더 중요할 수 있습니다.

이 성장 단계는 낮은 단계의 제품을 벌주는 등급표가 아닙니다. 아직 모르는 것을 모른다고 표시해 과장을 막고, 다음 실증에 쓸 돈과 시간을 어디에 집중할지 알려 주는 지도입니다.

90일 안에 PoC를 실사용 Evidence로 바꾸는 예시

제품이 이미 기본 기능을 갖췄다면 첫 90일을 세 구간으로 나눌 수 있습니다. 기간은 제품과 학교 일정에 따라 달라지지만, 해야 할 일의 순서는 이해하기 쉽습니다.

1일부터 15일까지는 질문과 경계를 정하는 기간입니다. 회사와 학교가 한 문장의 실증 질문을 합의하고, 대상 학년과 교과, 사용 시간, 비교 방식, 제품 버전을 정합니다. 개인정보 흐름을 그려 필요 없는 수집을 없애고, 심각한 오류가 나오면 누가 사용을 멈출지도 결정합니다. 시작 뒤에 유리한 결과만 고르지 않도록 주요 지표와 판정 기준도 이때 적습니다.

16일부터 30일까지는 준비와 작은 예행연습 기간입니다. 교사 몇 명이 학생 역할로 전체 과정을 사용하고, 로그인·기기·네트워크·화면읽기 기능을 확인합니다. 그다음 실제 학생 소수와 한두 번 수업해 문항이 이해되는지, 기록이 제대로 들어오는지 봅니다. 이때 발견한 문제는 고칠 수 있지만, 본 실증이 시작되면 버전 변경을 기록해야 합니다.

31일부터 86일까지는 실제 수업 기간입니다. 예시처럼 8주 동안 정해진 시간에 사용하고, 기준선·중간 관찰·종료 평가를 진행합니다. 플랫폼은 교사의 입력 부담을 줄이면서 제품 사용, 학습 변화, 안전 사건, 장애와 지원 요청을 한 시간선에 모읍니다. 중간 결과가 좋아 보여도 실증을 일찍 끝내지 않고, 나빠 보여도 안전 문제가 아니라면 대상을 몰래 바꾸지 않습니다.

87일부터 90일까지는 해석과 의사결정 기간입니다. 회사 혼자 결과를 고르지 않고 학교 담당자와 분석자가 함께 표본, 이탈, 비교 조건, 집단별 결과를 확인합니다. 마지막 산출물은 홍보용 성공 사례 한 장이 아니라, 제한 도입·추가 실증·전면 도입·보류 중 하나를 선택할 수 있는 Evidence Package입니다.

성공 기준은 결과를 보기 전에 정한다

축구 경기가 끝난 뒤 골대 크기를 바꾸면 공정하지 않습니다. 실증도 결과를 본 다음 성공 기준을 바꾸면 믿기 어렵습니다. 그래서 시작 전에 “어떤 결과면 다음 단계로 갈 것인가”를 적어 둡니다.

수학 AI 튜터라면 한 가지 숫자로 합격과 탈락을 결정하지 않습니다. 예를 들어 학습 결과는 비교 수업보다 향상 방향이 분명하고, 교사 준비 시간은 늘지 않으며, 과제 완료율은 목표 범위를 유지해야 한다고 정할 수 있습니다. 동시에 심각한 개인정보 노출은 한 건이라도 즉시 중단 조건으로 두고, 일반 오답률은 정해진 범위 아래여야 한다고 정합니다. 이 숫자는 제품 특성과 위험도, 학교의 기준에 맞춰 합의해야 하며 모든 제품에 똑같이 복사할 수는 없습니다.

효과 기준을 만족했지만 안전 기준을 넘지 못하면 도입하지 않습니다. 안전했지만 학생이 거의 사용하지 않았다면 사용 설계를 고쳐 다시 시험합니다. 평균 학습 효과는 좋지만 특정 집단의 결과가 나빠졌다면 그 집단을 위한 수정과 추가 검증이 먼저입니다. 이렇게 여러 문을 차례로 통과시키면 좋은 평균 하나가 큰 문제를 가리는 일을 줄일 수 있습니다.

판정 결과에는 이유가 붙어야 합니다. “통과” 대신 “5학년 분수 보충수업, 교사 감독, 현재 모델 버전에서 제한 도입 가능”처럼 범위를 적습니다. 학교 밖 자율학습이나 다른 학년에서 같은 결과가 난다고 보장하지 않는다는 뜻입니다. 제품이 바뀌거나 사용 범위가 넓어지면 새 질문으로 다시 검증합니다.

결론: 다음 승부는 기능 수가 아니라 증거의 길이다

PoC는 출발선입니다. 아이디어가 작동한다는 것을 보여 주지만, 실제 학생에게 도움이 되고 교사가 감당할 수 있으며 기관이 안전하게 책임질 수 있다는 사실까지 증명하지는 않습니다. 그 사이에는 실제 사용자, 충분한 기간, 공정한 비교, 학습 측정, 안전 관찰, 운영 기록이라는 긴 다리가 필요합니다.

EdTech Validation Platform은 그 다리를 놓습니다. 기업에는 어떤 부분을 고쳐야 하는지 알려 주고, 교사와 학생에게는 목소리와 사용 경험을 근거로 바꾸는 통로를 제공하며, 기관에는 광고 문구가 아닌 도입 판단 자료를 줍니다.

가장 좋은 질문도 달라져야 합니다. “AI가 멋지게 답했는가?”에서 멈추지 말고 “누가, 어느 교실에서, 얼마나 사용했고, 무엇이 좋아졌으며, 누구에게는 맞지 않았고, 어떤 위험을 어떻게 처리했는가?”까지 물어야 합니다. 이 질문에 차근차근 답할 수 있는 제품과 검증 플랫폼이 PoC를 넘어 실제 교육 서비스로 살아남을 가능성이 큽니다.


공식 참고자료