본문으로 건너뛰기

Redrob Image

오픈소스

프롬프트에서
내 기기의 이미지로.

약 8 스텝으로 끝나는 가벼운 text-to-image 모델입니다. 웨이트까지 Apache-2.0으로 공개해서, 받아서 고치고 다시 배포해도 됩니다.

공개 README에 있는 빠른 시작
Apache-2.0오픈웨이트약 8 스텝로컬 실행

라이선스: Apache-2.0

스타 0 · 언어 Python · 푸시 2026-08-07 · 기준 2026-08-07

Redrob Image 그레인 스틸

50 스텝이 아니라 8 스텝

일반 디퓨전 모델이 30~50 스텝을 쓰는 자리에서, 터보 샘플링으로 약 8 스텝에 한 장을 끝냅니다. 같은 그래픽카드에서 기다리는 대신 계속 고쳐볼 수 있다는 뜻입니다.

  • 이미지 한 장에 약 8 DiT 스텝
  • cfg 1 / guidance_scale=0, 두 번 돌지 않음
  • 네거티브 프롬프트는 무시되니 전부 포지티브로
50 스텝이 아니라 8 스텝

평범한 Diffusers 코드로 돕니다

전용 런타임도, 우리가 만든 래퍼도 없습니다. pip install diffusers 하고 from_pretrained로 불러오면, 이미 쓰던 코드가 그대로 돕니다.

  • 표준 Diffusers 파이프라인 API
  • 병합 UNET 하나로 배포
  • 가입도, 키 발급도 없음
평범한 Diffusers 코드로 돕니다

내 기기에 올라가는 크기

스텝이 적고 UNET이 하나라서 한 장당 메모리와 시간이 덜 듭니다. 빌린 클러스터가 아니라 소비자용 그래픽카드 한 장을 기준으로 만들었습니다.

  • 소비자용 GPU 한 장이 기준
  • 프롬프트와 결과물이 기기를 떠나지 않음
  • 경로 어디에도 외부 추론 서버 없음
내 기기에 올라가는 크기

웨이트까지 열려 있습니다

이름만 오픈이 아닙니다. 웨이트 자체를 Apache-2.0으로 Hugging Face에 올려 뒀습니다. 파인튜닝해서 제품에 넣고 다시 배포해도, 우리에게 물어볼 일이 없습니다.

  • 코드가 아니라 웨이트가 Apache-2.0
  • 상용 이용과 재배포 허용
  • 웨이트와 모델 카드는 Hugging Face에
웨이트까지 열려 있습니다

사진 쪽에 맞춰 튜닝했습니다

모든 걸 골고루 하려는 대신 사진, 인물, 무드에 튜닝을 몰았습니다. 빛이 있는 장면, 얼굴, 색감을 요구할 때 결과가 버텨 줍니다.

  • 사진: 빛, 깊이, 재질
  • 인물: 원본 크기에서도 버티는 얼굴과 피부
  • 무드: 조절되는 색감과 그레인
사진 쪽에 맞춰 튜닝했습니다

여기서는 약합니다

읽히는 텍스트에 약합니다. 한글을 비롯한 대부분의 비라틴 문자는 제대로 나오지 않고, 타이포 비중이 큰 그래픽 작업은 사진·인물 결과보다 한참 아래입니다.

  • 한글·비라틴 텍스트는 여전히 약점
  • 타이포 중심 그래픽은 강점이 아님
  • 한계는 숨기지 않고 공개
여기서는 약합니다
50 스텝이 아니라 8 스텝

무엇을 측정했나

GPT Image 2 상대 선호도 조사는 블라인드 90쌍에서 44-16-30으로 나왔습니다. 설계와 신뢰구간, 어느 범주에서 졌는지, 다음에는 표본을 어떻게 잡아야 하는지까지 이 페이지 밖에 정리해 뒀습니다.

측정 기록 보기

바로 만들어 볼까요

레포를 받아서 빠른 시작만 돌리면 됩니다. 가입도, API 키도 필요 없습니다.

pip install -U torch transformers accelerate safetensors && pip install -U diffusers

자주 묻는 질문

라이선스, 한계, 그리고 실제로 어떻게 돌아가는지. 모든 주장에는 방법과 유의 사항을 같이 답니다.