Compare
제품의 정문입니다. 어느 소스의 모델이든 카탈로그 데이터셋이나 내 프롬프트 위에서 텍스트·이미지로 직접 돌리고, 점수가 안 나오는 과제는 블라인드 선호도 대진으로 정합니다.
- 큐레이션, OpenRouter, 프런티어, 자체 호스팅 vLLM이 한 목록에
- 정답이 있는 과제만 품질 채점, 지연·TTFT·처리량은 항상 측정
- 프롬프트마다 블라인드 단판 토너먼트, 투표는 라우팅 라벨로

Redrob Eval
받는 곳 GitHub
Compare·Evolve·Deploy 세 모듈로 된 오픈 LLM 평가 워크벤치입니다. 프런티어 API, OpenRouter, 직접 띄운 vLLM 엔드포인트가 한 목록에 있습니다. 비용은 상대 비율로만 적습니다.
제품의 정문입니다. 어느 소스의 모델이든 카탈로그 데이터셋이나 내 프롬프트 위에서 텍스트·이미지로 직접 돌리고, 점수가 안 나오는 과제는 블라인드 선호도 대진으로 정합니다.

명시적 품질 하한 아래에서 지시문·데모·모델·정책을 GEPA로 탐색합니다. 카탈로그 데이터셋을 쓰거나, 내 목표와 루브릭을 LLM 심판 또는 체크리스트 QWK로 채점합니다.

SSH로 내 GPU 호스트에 모델을 직접 서빙합니다. 측정, 기동, 헬스체크, 벤치마크, 재접속 가능한 터미널까지 있습니다. 서빙한 엔드포인트는 다시 Compare에 올려 프런티어와 겨룹니다.


모듈 전체와 우리가 스스로 지키는 규칙을 한자리에 뒀습니다.
Compare
어느 소스의 모델이든 내 프롬프트 위에서 바로
Evolve
명시적 품질 하한 아래 GEPA 탐색
Deploy
SSH로 내 GPU에 모델 직접 서빙
블라인드 선호도
프롬프트마다 이름 가린 단판 토너먼트
선호도 기반 라우팅
사람 투표가 지표와 같은 라우팅 코퍼스로
텍스트와 이미지
한 실행 경로에 모달리티, 오디오도 같은 자리에
상대 비용
기준 대비 비율만, 절대 통화 없음
원샷 테스트셋
한 번만 보고, 같은 슬라이스를 몰래 재사용하지 않음
서버 사이드 키
프로바이더 키는 내 서버에만
Apache-2.0
허가 없이 받고, 고치고, 출시까지
웹 워크벤치
UI와 하네스를 한 공개 레포에
공개된 한계
된 것 옆에 안 된 것도 같이 적음
공개 레포 받아가는 경로
GitHub가 먼저, 이 허브는 레포로 넘기는 통로
공개 레포를 받아서 로컬에서 돌려 보면 방법이 그대로 보입니다.
01
공개 레포를 받고, .env.example을 .env로 복사한 뒤 프로바이더 키를 넣습니다.
02
yarn install && yarn dev 후 localhost:3939를 엽니다. 키는 서버에 둡니다.
03
Compare로 모델을 고르고, 품질 하한 아래에서 진화시킨 뒤, 고른 모델을 서빙합니다.
git clone https://github.com/redrob-labs/redrob-eval.git && cd redrob-eval && yarn install && yarn dev라이선스, 한계, 그리고 실제로 어떻게 돌아가는지. 모든 주장에는 방법과 유의 사항을 같이 답니다.