본문으로 건너뛰기

Redrob Eval

받는 곳 GitHub

모델을 비교하고
내 테스트셋으로 추립니다.

Compare·Evolve·Deploy 세 모듈로 된 오픈 LLM 평가 워크벤치입니다. 프런티어 API, OpenRouter, 직접 띄운 vLLM 엔드포인트가 한 목록에 있습니다. 비용은 상대 비율로만 적습니다.

Compare

제품의 정문입니다. 어느 소스의 모델이든 카탈로그 데이터셋이나 내 프롬프트 위에서 텍스트·이미지로 직접 돌리고, 점수가 안 나오는 과제는 블라인드 선호도 대진으로 정합니다.

  • 큐레이션, OpenRouter, 프런티어, 자체 호스팅 vLLM이 한 목록에
  • 정답이 있는 과제만 품질 채점, 지연·TTFT·처리량은 항상 측정
  • 프롬프트마다 블라인드 단판 토너먼트, 투표는 라우팅 라벨로
Compare

Evolve

명시적 품질 하한 아래에서 지시문·데모·모델·정책을 GEPA로 탐색합니다. 카탈로그 데이터셋을 쓰거나, 내 목표와 루브릭을 LLM 심판 또는 체크리스트 QWK로 채점합니다.

  • 오프라인에서 다시 뽑는 베이스라인 대비 진화 리포트와 Pareto 차트
  • train·val은 최적화해도 되지만, test는 한 번만 보고하고 재사용은 거부
  • 토크나이저 fertility가 데모 수를 제한, demos_requested와 demos_fitted를 확인
Evolve

Deploy

SSH로 내 GPU 호스트에 모델을 직접 서빙합니다. 측정, 기동, 헬스체크, 벤치마크, 재접속 가능한 터미널까지 있습니다. 서빙한 엔드포인트는 다시 Compare에 올려 프런티어와 겨룹니다.

  • 자체 호스팅 상대 비용은 공시 단가가 아니라 측정한 처리량에서
  • FP8과 bf16 차이는 항상 결과 주의사항에 표기
  • GPU 호스트 설정은 gitignore된 루트 .env 안에만
Deploy
Compare

그 밖에도 많습니다

모듈 전체와 우리가 스스로 지키는 규칙을 한자리에 뒀습니다.

Compare

어느 소스의 모델이든 내 프롬프트 위에서 바로

Evolve

명시적 품질 하한 아래 GEPA 탐색

Deploy

SSH로 내 GPU에 모델 직접 서빙

블라인드 선호도

프롬프트마다 이름 가린 단판 토너먼트

선호도 기반 라우팅

사람 투표가 지표와 같은 라우팅 코퍼스로

텍스트와 이미지

한 실행 경로에 모달리티, 오디오도 같은 자리에

상대 비용

기준 대비 비율만, 절대 통화 없음

원샷 테스트셋

한 번만 보고, 같은 슬라이스를 몰래 재사용하지 않음

서버 사이드 키

프로바이더 키는 내 서버에만

Apache-2.0

허가 없이 받고, 고치고, 출시까지

웹 워크벤치

UI와 하네스를 한 공개 레포에

공개된 한계

된 것 옆에 안 된 것도 같이 적음

공개 레포 받아가는 경로

GitHub가 먼저, 이 허브는 레포로 넘기는 통로

시작하기

공개 레포를 받아서 로컬에서 돌려 보면 방법이 그대로 보입니다.

01

받고 설정하기

공개 레포를 받고, .env.example을 .env로 복사한 뒤 프로바이더 키를 넣습니다.

02

설치하고 실행

yarn install && yarn dev 후 localhost:3939를 엽니다. 키는 서버에 둡니다.

03

비교하고 진화시키고 서빙

Compare로 모델을 고르고, 품질 하한 아래에서 진화시킨 뒤, 고른 모델을 서빙합니다.

git clone https://github.com/redrob-labs/redrob-eval.git && cd redrob-eval && yarn install && yarn dev

자주 묻는 질문

라이선스, 한계, 그리고 실제로 어떻게 돌아가는지. 모든 주장에는 방법과 유의 사항을 같이 답니다.