EXAMRIZZ 2026
— Welcome

Data Engine
byExamRizz

ExamRizz 문제은행 안내서
ExamRizz.
Stream Learning Ltd
examrizz.com
EXAMRIZZ · 사업 역량 안내서 2026 · v1.0

출제의 정합성에서
출발한 평가 엔진.

ExamRizz — built for construct validity.
ExamRizz의 정체와 운영진, 그리고 실제 산출물에 관한 짧은 안내서입니다. 핵심은 단순합니다 — AI가 생성한 문항, 출제진이 직접 작성한 문항, 그리고 ExamRizz가 만든 문항의 차이는 영어 표현의 유려함이 아닙니다. 문항이 측정하고자 하는 바를 실제로 측정하는가의 문제입니다.
01 ExamRizz 소개 About ExamRizz & Engine Quality

ExamRizz는 Stream Learning Ltd가 개발한 AI 영어 평가 엔진입니다. 본 시스템은 강남 소재 자체 학원인 JSB College에서 2018년부터 실제 수업에 적용·개선되어 왔으며, 누적 300명 이상의 학생을 대상으로 학습 성과 데이터가 축적되어 있습니다. 이 누적 데이터 — 실제 교실 사용, 실제 학생 응답, 반복적 개선 — 이 ExamRizz를 단순 프롬프트 기반 도구와 구분 짓는 결정적 층위입니다.

병행 플랫폼인 examrizz.com은 영국에서 A Level 및 대학 입시 영어 학습 서비스로 운영되며, 한국 시장과는 다른 교육과정 맥락에서의 보정 데이터를 제공합니다. 두 플랫폼이 함께 작동함으로써 엔진은 단일 시장의 견해가 아닌, 교차 검증된 데이터에 기반하여 발전하고 있습니다.

팀은 세계 최대 규모의 교육 기술 컨퍼런스인 BETT 2026에 출품·발표를 진행하였으며, 양국에서 학교 파트너십 협의를 활발히 이어가고 있습니다. ExamRizz의 로드맵은 2028년 한국 평가 개혁으로 확대되는 논·서술형 평가, 그리고 보다 근본적으로 — 생성이 값싸진 시대에 학습의 증거란 무엇인가 — 라는 질문을 토대로 설계되어 있습니다.

AI가 학습의 증거 양식을 바꾸고 있는 이 시점, 그리고 한국의 평가 체계가 2028년 개혁을 통해 논·서술형 평가로 확장되는 이 시점에 — 영어 평가가 변별력 있고, 공정하며, 교육적으로 의미 있도록 설계하는 것.

엔진의 품질 — 출력물이 다른 네 가지 이유 The Engine — Quality Argument

— 01
추측이 아닌, 보정.
ExamRizz는 실제 학생 응답 데이터로 학습된 모델을 통해 문항 난이도를 예측하며, 과거 수능 문항 140개 세트에 대해 RMSE 4.8%로 검증되었습니다. 일반 AI는 패턴으로 난이도를 추측하지만, ExamRizz는 학생들이 유사 문항에서 실제로 어떻게 행동하는지를 기반으로 예측합니다.
— 02
설계 단계부터 갖춘 구인 타당도.
모든 지문은 한국 평가 형식이 실제로 측정하는 인지 작용에 대응하는 네 가지 차원 — 목적(Purpose), 논리(Logic), 근거(Evidence), 약점(Weakness) — 분석을 거칩니다. 이는 주제·함의·빈칸·순서 문항을 단순한 표면 형식이 아닌, 정확한 난이도 메커니즘으로 표적화할 수 있게 합니다.
— 03
검증 가능한 출력.
모든 산출물에는 추적 정보가 동반됩니다 — 왜 이 지문인지, 왜 이 문항 유형인지, 왜 이 오답 선택지인지, 왜 이 난이도 구간인지. 검수자는 정답표를 확인하는 것이 아니라 출제 논리 자체를 점검합니다. 이는 AI 기본법 대응 및 콘텐츠 책임을 지는 모든 기관에 중요합니다.
— 04
한국 학생 글쓰기에 기반한 학습.
수년간 누적된 교실 데이터를 통해 시스템은 한국 EFL 학습자가 실제로 어떻게 실수하는지 — 어떤 함정이 작동하는지, 어떤 오답이 선택되는지, 어떤 추론을 학생들이 놓치는지 — 에 대해 보정되어 있습니다. 일반 웹 텍스트로 훈련된 모델은 이 층위를 재현할 수 없습니다.
02 생산 가능한 출력물 What we produce
03 실제 산출물 분석 Worked Example

최근 제작된 고3 모의고사의 32번 문항을 한 가지 사례로 살펴보겠습니다. 본 예시는 의도적으로 고난도로 설정되었습니다 — 추측이 아닌 보정을 통해 진정으로 어려운 문항을 생산하는 것이 현재 시장에서 충족되지 않은 영역 중 하나입니다. ExamRizz는 평균 난이도의 그럴듯한 문항을 만드는 데 그치지 않고, 바로 그 영역을 채우기 위해 설계되었습니다.

— 예시 A · 모의고사 32번 · 빈칸 (Cloze, 결론부) 난이도 상 · 3점
원 지문 · Source Passage
Recent neuroscientific research detects motor preparation in the brain hundreds of milliseconds before a participant reports having decided to move. Some commentators conclude that the conscious self is not the originator of its decisions, so free will is illusory. The argument depends on equating freedom with the absence of prior causation, a position compatibilism abandoned long ago. Compatibilists, from Hobbes through Frankfurt and Dennett, have held that an action is free when its cause is responsive to reasons rather than coerced. Whether the cause runs through neurons firing before conscious awareness has not been the issue. Compatibilists themselves differ over which causes qualify; none rests on the temporal priority of consciousness. Neuroscience establishes the temporal order of neural events. The argument from neuroscience, on this reading, is .
자작 지문 — Daniel C. Dennett, Freedom Evolves (2003)을 모티브로 한 원전 변형. 기존 자료와 중복 없음.
PLEW 분석 · PLEW Profile
P
목적(Purpose): 결론은 구조적이다 — 신경과학은 양립가능론이 제기하는 것과 다른 질문에 답한다. 결론부 빈칸으로 의도적으로 유보됨.
L
논리(Logic): 6단계 사슬이 범주 불일치(시간 순서 vs. 원인 종류)로 귀결된다.
E
근거(Evidence): 양립가능론 전통(Hobbes, Frankfurt, Dennett)이 주장을 역사적으로 정박시킨다.
W
약점(Weakness): 신경과학의 경험적 내용은 인정되며, 논리적 도달 범위만 부정된다.
다음 빈칸에 들어갈 말로 가장 적절한 것은?
① directed at a question other than the one this debate has long been about
② a valid challenge to the conscious self's status as the originator of action
③ that free will is illusory as the conscious self is not the originator…
④ sufficient to settle the internal disagreements among compatibilists themselves
⑤ evidence that aligns with the compatibilist position rather than threatening it
정답① — directed at a question other than the one this debate has long been about
변별 1순위 — 오답 ⑤
"evidence that aligns with the compatibilist position." 논증을 정확히 따라간 학생들(신경과학은 양립가능론을 위협하지 않는다)이 한 단계 더 추론하려는 유혹에 빠집니다(따라서 양립가능론을 지지한다). 그러나 지문은 약한 주장만을 뒷받침할 뿐, 강한 주장은 지문이 제공하지 않는 한 단계의 추론을 요구합니다. 이것이 3점 문항과 2점 문항을 구분 짓는 정확한 실패 양식입니다.
함정은 학생들이 방어적 입장을 감지했을 때 일반적으로 과잉 외삽한다는 사실에 기반합니다. 이는 텍스트의 속성이 아니라 학습자가 글을 읽는 방식의 속성입니다. 일반 AI는 이를 보정할 수 없습니다 — 학생 추론 모델이 없기 때문입니다.

객관식을 넘어서 — Paraphrase Variants & 서술형

동일한 엔진이 보정된 패러프레이즈 변형과 채점 가능한 루브릭을 갖춘 서술형 문항을 생산합니다 — 모두 프롬프트 기반 AI가 재현할 수 없는 영역입니다. 양자 모두 표면적 그럴듯함이 아니라 논리 거리와 논리 충실도를 모델링해야 하기 때문입니다. 최근 제작된 방관자 효과 내신 세트에서 추출한 두 가지 압축 표본을 보여드립니다.

— 표본 01 패러프레이즈 변형 · 3단계 논리 거리 변형 동일 원 지문 · 점진적으로 깊어지는 재구성
L1 어휘·구문
표면 어휘와 문장 구조는 재진술되지만, 논리 구조·명명된 메커니즘·근거 기반은 완전히 보존됩니다. 지문 자체가 내용 수준 문항으로 시험 가능한 상태로 남아야 할 때 사용됩니다.
사용처내용일치
어법 전환
기본 내신
L2 구조
논증이 재배열·재구성됩니다. 명명된 두 메커니즘이 서사 속에 매립되지 않고 번호 매긴 주장으로 제시되며, 핵심 주장은 마지막 절로 재진술됩니다. 문항이 표면 내용이 아닌 논증 구조를 표적으로 할 때 적합합니다.
사용처빈칸 (절)
요약문
중급 내신
L3 구조적 재구성
추론이 철학적 등록의 수준에서 재구축됩니다. 메커니즘 명칭은 추상화되고, 근거 기반은 제거되며, 핵심 주장과 논리 유형만 유지됩니다. 고급 추론 학습 및 학생이 원전의 언어를 그대로 재현하지 않고 기저 논리를 명료화해야 하는 서술형 출제에 사용됩니다.
사용처서술형 조건영작
함의추론
2028 서술형
이것이 아닌 것. 동의어 치환과 문장 단위 재진술 — 프롬프트 기반 AI가 산출하는 "패러프레이즈" — 은 모든 단계에서 논리 충실도 검증에 실패합니다. 문법은 보존하면서 인과 방향이나 행위자 귀속을 파괴하는 표면 변형은 AI 패러프레이즈 도구의 가장 흔한 실패 양식이며, ExamRizz가 정확히 그것에 대응하여 보정된 영역입니다.
— 표본 02 서술형 출제 · 조건영작 with 논리 충실도 루브릭 2028 개혁 대응 · 4점 배점
다음 우리말을 조건에 맞게 영작하시오.
「방관자가 많을수록, 각 개인이 느끼는 개인적 책임감은 줄어든다. 이것은 책임의 분산(diffusion of responsibility)으로 알려진 과정이다.」
조건: ① 두 문장으로 작성  ② 첫 문장: 비교급 구문 사용 (the + 비교급, the + 비교급)  ③ 제시어 포함: bystander, responsibility, diffusion  ④ 총 20단어 이상
점수
채점 기준 · 형식
ExamRizz 논리 충실도 판단
4
비교급 구문 정확 · 제시어 3개 모두 포함 · 단어수 충족
인과 방향 보존(방관자 多 → 책임 少). 메커니즘 라벨이 과정에 정확히 부착됨.
2
비교급 구문 미사용, 일반문으로 작성 / 제시어 1개 누락
비례적 인과 주장이 살아있는 경우에만 부분 점수. 인과 방향 역전 시 → 문법 무관 0점.
0
논리 불일치 답안 (문법 통과, 논리 실패)
논리 실패 예시: "Bystanders feel diffusion of responsibility, so they help less" — 행위자–피동자 역전. 문법 통과, 논리 실패. 규칙 기반 검수는 잡을 수 없음.
2028년 개혁에서의 의미. 내신에서 서술형 평가가 확대되는 개혁은 평가 시스템에 새로운 요구를 부과합니다 — 학생 글쓰기를 문법 준수만으로 채점하는 것은, 학생 논증이 기저 인과 논리를 보존하는가가 핵심 질문일 때 불충분합니다. ExamRizz의 루브릭 모델은 논리 충실도를 일차 축으로, 표면 준수를 이차 축으로 취급합니다 — 개혁이 함의하는 우선순위 그대로입니다.
04 동일 지문, 세 가지 출력 방식 Generic AI · Human · ExamRizz

한국 고등학교 영어 교과에서 널리 다루는 주제인 방관자 효과(bystander effect)에 관한 짧은 예시 지문이, 어떤 접근 방식을 사용하는가에 따라 놀랄 만큼 다른 문항 산출물로 이어집니다. 차이는 문체에 있지 않습니다. 구조에 있습니다.

공통 원 지문 · Source Passage
The bystander effect is one of the most studied phenomena in social psychology. It describes how an individual's likelihood of intervening in an emergency decreases as the number of bystanders increases. The mechanism, replicated consistently across controlled experiments since the late 1960s, involves diffusion of responsibility and pluralistic ignorance: each observer assumes someone else will act, while reading the inaction of others as a signal that the situation is not in fact serious. The phenomenon is therefore not best understood as a failure of individual courage. We do not act on what we observe; we act on what we infer others have concluded from what they observe.
— 접근 01

일반 AI

범용 언어 모델을 활용한 프롬프트 기반 생성.
속도
수 초
비용
거의 무시할 수준
구인 타당도
검증 안 됨
오답
표면적 재진술
검증 추적
없음
한계
변별력 — 우수 학생이 부진 학생과 분리되지 않음
— 출력 예시
What is the main idea of the passage?
The bystander effect occurs when many people are present
Bystanders sometimes fail to act when emergencies happen
Group situations reduce individual responsibility to act
Psychological experiments confirm bystander behavior
Witnesses sometimes fail to help in emergencies
오답들은 지문 문장의 단순 재진술입니다. 어느 것도 특정 오독 양식에 매핑되지 않습니다. 처음 세 문장만 읽어도 정답에 도달할 수 있습니다.
— 접근 02

출제진 직접 작성

경험 있는 출제자가 지문을 보고 수작업으로 작성.
속도
문항당 30–60분
비용
상당함
구인 타당도
높음 (작성자 의존)
오답
정교하나 균질하지 않음
검증 추적
작성자 숙련도에 암묵적
한계
규모 및 작성자 간 일관성
— 출력 예시
다음 글의 주제로 가장 적절한 것은?
the social mechanism by which individuals interpret others' inferences
the long history of experimental research on bystander behaviour
how individuals act on inferences about what others perceive
diffusion of responsibility as the cause of inaction
why scientific accounts of bystander behaviour have varied
우수한 작성물입니다 — 오답이 정교하고 잘 조율되어 있습니다. 그러나 품질은 어느 작성자가 만들었는가에 전적으로 의존하며, 다른 작성자가 50문항을 생산할 경우 동일한 기준으로 수렴하지 않습니다.
— 접근 03

ExamRizz

PLEW 분석이 부착되고 난이도가 예측된 보정 엔진 출력.
속도
수 초
비용
규모에 비례 (선형)
구인 타당도
문항별 검증
오답
각각 오독 양식에 매핑
검증 추적
전체 PLEW + 난이도 추적
한계
검수 필요 경계 사례 (자동 플래그)
— 출력 예시
다음 글의 주제로 가장 적절한 것을 고르시오.
the social cost of failing to intervene in public emergencies
why people fail to help in emergencies due to fear
how inferences about others' perceptions shape individual behaviour
the definition and causes of the bystander effect
why psychological experiments on bystander behaviour produce inconsistent results
각 오답이 기록된 오독 양식에 매핑됩니다: ① 도덕적 프레임 치환, ② 감정적 오귀속, ④ 제목 패턴 매칭, ⑤ 양보 구절 과도 확장. 난이도 보정; 추적 정보 납품 전 검토 가능.
05 협업 안내 Working with us
— 입력물 · Inputs
제공해 주실 자료

교과서 단원 PDF, 기존 지문 자료, 주제 사양, 교육과정 프레임워크, 또는 검수가 필요한 문항 자료.

— 출력물 · Outputs
납품 형식

HTML, PDF, 그리고 구조화된 데이터(JSON). 주 단위가 아닌 일 단위 납품. 품질 저하 없이 규모 확장 가능.

— 품질 검증 · Verification
검증 방식

모든 산출물에 구조 추적 정보와 난이도 보정 정보가 첨부됩니다. 최종 납품 전 검토 가능; 요청 시 수정.

전체 문제(완성된 모의고사 1회분, 정답과 해설 1부, 또는 내신 변형 문항 세트)를 요청하시려면 서울 강남 본부장에게 문의바랍니다.
ExamRizz · Stream Learning Ltd 사업 역량 안내서 · 2026