50 스텝이 아니라 8 스텝
일반 디퓨전 모델이 30~50 스텝을 쓰는 자리에서, 터보 샘플링으로 약 8 스텝에 한 장을 끝냅니다. 같은 그래픽카드에서 기다리는 대신 계속 고쳐볼 수 있다는 뜻입니다.
- 이미지 한 장에 약 8 DiT 스텝
- cfg 1 / guidance_scale=0, 두 번 돌지 않음
- 네거티브 프롬프트는 무시되니 전부 포지티브로

Redrob Image
오픈소스약 8 스텝으로 끝나는 가벼운 text-to-image 모델입니다. 웨이트까지 Apache-2.0으로 공개해서, 받아서 고치고 다시 배포해도 됩니다.




일반 디퓨전 모델이 30~50 스텝을 쓰는 자리에서, 터보 샘플링으로 약 8 스텝에 한 장을 끝냅니다. 같은 그래픽카드에서 기다리는 대신 계속 고쳐볼 수 있다는 뜻입니다.

전용 런타임도, 우리가 만든 래퍼도 없습니다. pip install diffusers 하고 from_pretrained로 불러오면, 이미 쓰던 코드가 그대로 돕니다.

스텝이 적고 UNET이 하나라서 한 장당 메모리와 시간이 덜 듭니다. 빌린 클러스터가 아니라 소비자용 그래픽카드 한 장을 기준으로 만들었습니다.

이름만 오픈이 아닙니다. 웨이트 자체를 Apache-2.0으로 Hugging Face에 올려 뒀습니다. 파인튜닝해서 제품에 넣고 다시 배포해도, 우리에게 물어볼 일이 없습니다.

모든 걸 골고루 하려는 대신 사진, 인물, 무드에 튜닝을 몰았습니다. 빛이 있는 장면, 얼굴, 색감을 요구할 때 결과가 버텨 줍니다.

읽히는 텍스트에 약합니다. 한글을 비롯한 대부분의 비라틴 문자는 제대로 나오지 않고, 타이포 비중이 큰 그래픽 작업은 사진·인물 결과보다 한참 아래입니다.


GPT Image 2 상대 선호도 조사는 블라인드 90쌍에서 44-16-30으로 나왔습니다. 설계와 신뢰구간, 어느 범주에서 졌는지, 다음에는 표본을 어떻게 잡아야 하는지까지 이 페이지 밖에 정리해 뒀습니다.
측정 기록 보기pip install -U torch transformers accelerate safetensors && pip install -U diffusers라이선스, 한계, 그리고 실제로 어떻게 돌아가는지. 모든 주장에는 방법과 유의 사항을 같이 답니다.