Research
고객에게 틀린 답을 하지 않는 AI — 검증된 정확도 87.8%
AI가 취향을 잊고, 바뀐 규정을 옛 기준으로 답하고, 시간 질문에 엉뚱한 날짜를 대는 이유는 검색만으로는 못 푸는 문제이기 때문입니다. Schift는 업계 표준 메모리 시험에서 87.8%로 그 벽을 넘었습니다.
AI가 고객에게 틀린 답을 한 번 하면, 그 비용은 오답 하나로 끝나지 않습니다. 환불 규정을 잘못 안내하고, 바뀐 가격을 옛날 기준으로 답하고, “지난번에 말씀하신 그거”를 엉뚱하게 기억합니다. 담당자가 매번 확인하고 고쳐야 한다면, AI를 도입한 이유가 사라집니다.
Schift는 이 문제를 정면으로 풀었습니다. 긴 대화와 방대한 문서 속에서 필요한 정보를 정확히 기억하고 최신 상태로 답하는 능력을, 업계 표준 시험(LongMemEval-S)에서 **87.8%**로 입증했습니다. 공개된 주요 AI 메모리 시스템을 모두 앞서는 수준입니다.
이 정확도가 현장에서 의미하는 것
| 실제 업무 상황 | Schift를 쓰면 |
|---|---|
| 고객 응대 (CS) | 고객의 과거 문의·방침·취향을 기억해, 매번 다시 묻지 않고 일관되게 답합니다 |
| 규정·정책 안내 | 규정이 바뀌면 최신 기준으로 답합니다 — 옛 정보로 잘못 안내하는 리스크를 줄입니다 |
| 사내 지식 Q&A | 여러 문서·대화에 흩어진 내용을 종합해 하나의 정확한 답을 냅니다 |
| 이력·일정 확인 | ”저번 계약 언제까지였죠” 같은 질문에 정확한 날짜로 답합니다 |
일반적인 AI는 “비슷한 문장”을 찾는 데 그칩니다. Schift는 대화를 쌓을수록 핵심 사실을 정리해 기억으로 축적하기 때문에, 검색만으로는 놓치는 정보까지 붙잡아 답합니다. 실제 시험에서, 일반 검색이 완전히 실패한 질문의 61%를 Schift의 기억이 정확히 답했습니다.
검증된 숫자로 비교하세요
LongMemEval-S는 AI가 수십 개 대화에 흩어진 정보를 기억하고, 과거 발언·바뀐 사실·취향·시간 순서까지 종합해 답하는지를 재는, 업계에서 가장 널리 쓰이는 메모리 시험입니다.
| 항목 | Schift | Supermemory | Zep | 전체 맥락 주입 |
|---|---|---|---|---|
| 종합 정확도 | 87.8% | 81.6% | 71.2% | 60.2% |
| 선호·방침 기억 | 83.3% | 70.0% | 56.7% | 20.0% |
| 지식 업데이트 | 82.1% | 88.5% | 83.3% | 78.2% |
| 시간 관련 질문 | 88.7% | 76.7% | 62.4% | 45.1% |
| 다중 대화 종합 | 82.0% | 71.4% | 57.9% | 44.3% |
공개·독립 평가 기준(LongMemEval-S, 공식 채점 동급)으로 측정했습니다. 경쟁사 수치는 공개 보고치이며, 시스템별 답변 모델·평가 방식 차이가 있을 수 있습니다.
정확하면서, 실제로 감당 가능한 비용
정확도만 높고 비용이 감당 안 되면 프로덕션에 못 씁니다. Schift는 이 정확도를 정답 하나당 통상 방식(전체 대화를 통째로 모델에 밀어넣기) 대비 약 1/6.5 비용으로 냅니다. 벤치 숫자가 아니고, 실제 CS 봇·사내 지식 Q&A에 그대로 붙일 수 있는 정확도와 비용입니다.
그리고 인프라를 직접 구축할 필요가 없습니다. 문서를 올리면 바로 쓰기 시작할 수 있습니다.
틀리지 않는 AI, 검증된 숫자, 감당 가능한 비용.
Schift는 단순한 대화 저장소가 아니라, 개인과 팀의 맥락을 정확하고 최신으로 유지하는 AI 메모리 인프라입니다. 도입 상담은 문의하기에서 시작하세요.
RAG Lab 구독
schift 만들면서 직접 굴린 RAG 실험 일지. 매주 새 실험이 올라옵니다.