프로젝트
Redrob Image
블라인드 90쌍 44-16-30(내부 평가자)
n=90에서 구간은 대략 ±10포인트: 큰 격차 배제, 동등성 미입증. 공개 주장용이 아니라 계속 개발 여부를 위한 결정 연구. 지연은 g7e.2xlarge 1대(NVIDIA RTX PRO 6000 Blackwell Server Edition, 96 GB; 모델 상주, 큐 제외)에서 end-to-end 약 1.8초. Studio가 클라이언트이고, 이 페이지는 모델 경로를 다룹니다.
요약
오픈 웨이트 Z-Image Turbo 머지(Apache-2.0, 상업적 이용 가능). 일반 디퓨전 모델이 30~50 스텝을 쓰는 자리에서 약 8 DiT 스텝에 한 장을 끝냅니다. 표준 Diffusers 파이프라인이나 병합 ComfyUI UNET 하나로 돌고, 빌린 클러스터가 아니라 소비자용 GPU 한 장이 기준입니다. GPT Image 2 대비 블라인드 선호 44-16-30(n=90, 내부 평가자). 큰 격차 배제, 동등성 미입증. 베이스 대비 피부·빛·텍스처가 낫고 사진·포트레이트·무드에 강하며, 한글을 비롯한 비라틴 문자 등 읽히는 텍스트에는 약합니다. g7e.2xlarge 1대(NVIDIA RTX PRO 6000 Blackwell Server Edition, 96 GB; 모델 상주, 큐 제외)에서 end-to-end 장당 약 1.8초. 측정 가동률 50% 기준 완전 부하 단가는 API 정가의 약 1/40(소유 하드웨어 비용 vs 공개 가격; 가동률 의존). 아래 샘플은 Redrob Image 출력입니다.
담당
모델 선정(Z-Image Turbo 오픈 웨이트), 블라인드 선호 설계, Studio 베이크오프 운영을 담당. 호스팅은 Studio 셸과 공유.
목적
인터랙티브 베이크오프가 가능한 지연과, 강한 호스티드 베이스라인 대비 선호에서 계속 개발할 근거가 되는 Apache-2.0 오픈 웨이트 이미지 모델. 사용·상업적 이용·재배포 자유이고, 소비자용 GPU 한 장이 차선책이 아니라 기준이 될 만큼 가볍게 만듭니다.
선호도 스터디
Redrob Image vs GPT Image 2 블라인드 일대일 선호(n=90). 맥락: frontier API 요금과 장당 20-180초 지연. 기준: 방어 가능한 단가에서의 제품 적합도. 결과가 Studio의 프로덕션 이미지 모델을 결정.
설계
- GPT Image 2와 일대일 비교; 무승부 허용
- 평가자·실험자 모두 시스템 신원에 블라인드
- 수집 전 고정 프롬프트 카테고리 15개; 카테고리당 6회(총 90회)
- 독립 2라운드; 라운드마다 평가자·프롬프트 세트 상이
- 공개 벤치마크가 아닌 제품 분포에서 추출한 프롬프트
- 예산 50만 원; 기간 3주
2라운드는 1라운드 재평가가 아님. 평가자와 프롬프트가 모두 다른 독립 반복 2회.
무승부 17.8%. 승패로 강제하면 존재하지 않는 신호를 만듦.
실험자 블라인드는 프롬프트 선택, 제시 순서, 연구 중 판단을 제약.
결과
- Redrob Image 승
- 44
- 무승부
- 16(17.8%)
- GPT Image 2
- 30
- 무승부 제외
- 44/74 = 59.5%95% CI [47.4%, 70.7%] · p = 0.130 · Clopper-Pearson
- 무승부 분할
- 52/90 = 57.8%p = 0.140
- 무승부를 패로 처리
- 44/90 = 48.9%95% CI [38.2%, 59.7%] · p = 0.916 · Clopper-Pearson
블라인드 90쌍 44-16-30(내부 평가자). 이 n에서 구간은 대략 ±10포인트: 큰 격차 배제, 동등성 미입증. 공개 주장용이 아니라 계속 개발 여부 결정용. 무승부 제외 59.5%, 95% CI [47.4%, 70.7%], p = 0.130: 구간이 50%를 포함. 무승부 처리 3가지 모두 동일하게 비동등.
한계
n=90, 내부 평가자, 단일 프롬프트 분포. 설계상 underpowered. 평가자는 시스템 구축 주체에 대해 블라인드가 아님.
지는 부분
가장 약한 카테고리(Redrob Image : 무승부 : GPT Image 2; 각 6회):
- Risograph 그래픽 일러스트
- 1 : 0 : 5
- 픽셀아트 / 포토리얼 합성
- 2 : 0 : 4
- 그래픽 디자인, 하프톤 텍스트 오버레이
- 2 : 0 : 4
- 빈티지 테크니컬러 필름
- 1 : 1 : 4
가장 강한 카테고리(대조):
- 드라마틱 포트레이트
- 5 : 0 : 1
- 다크 무드 디지털 아트
- 5 : 1 : 0
- 아날로그 흑백 포트레이트
- 4 : 2 : 0
- 이중노출 합성
- 4 : 1 : 1
사진·포트레이트는 Redrob Image, 그래픽·인쇄·텍스트 포함은 GPT Image 2 쪽. 이 패턴이 라우팅을 결정. 셀 단위로는 미입증.
카테고리 의존성 omnibus: p = 0.096(시사적, 비유의). 개별 카테고리는 15검정 Bonferroni를 통과하지 못함. 셀당 6회면 6-0도 p = 0.031, 보정 α = 0.0033. 이 설계로는 유의한 단일 카테고리 결과가 구조적으로 불가능. 표본 크기 설계의 결함이지 모델 속성이 아님. 셀 패턴은 라우팅 참고용이며 확정 발견이 아님.
15개 카테고리를 사후 그룹으로 묶으면 패턴이 결정적으로 보임. 그룹은 사전 지정이 아니므로 해당 p-value는 보고하지 않음. 카테고리는 사전 고정, 그룹은 비고정.
텍스트 렌더링이 운영 규칙을 결정. 직접 증거는 얇음(하프톤-텍스트 2-0-4, p = 0.69). 근거는 인접 그래픽·인쇄 셀의 방향 수렴과 이 계열 모델의 알려진 구조적 실패 모드이지, 유의한 셀 결과가 아님.
운영 규칙: 가독 텍스트가 필요한 표면은 frontier API로 라우팅.
바꾸고 싶은 점
- 카테고리당 6회로는 단일 카테고리 주장이 구조적으로 불가능. 유용한 최소 셀 크기: 10.
- 라운드 간 평가자 겹침 없음: inter-rater reliability 계산 불가, 평가자 효과와 프롬프트 세트 효과 혼동. 공유 앵커 5문항이면 거의 무비용으로 해결 가능했음.
- 동등성 검정력 부족. ±10포인트·80% power에 155회, ±5에 619회. 현재 데이터는 최대 ±19포인트 마진까지.
- 카테고리 그룹은 사전 지정했어야 함. 없으면 그룹 패턴은 가설이지 발견이 아님.
- 확정용 재실행: 현재의 약 5배(평가자 병렬 시 약 250만 원, 3-4주).
오픈 웨이트는 Apache-2.0이며 상업적 이용이 가능합니다. 속도는 Z-Image Turbo 증류에서 옴. 지속 자산은 평가 증거와 가중치.
결정
자연어 해부학을 위해 Stable Diffusion 폐기
Stable Diffusion을 Klein 4B, Z-Image Turbo와 비교. SD는 깨끗한 해부학에 좁은 프롬프트 방언이 필요하고, 일반 언어에서는 실패. 그 방언은 수용 불가.
포토리얼리즘에도 불구하고 Klein 기각
Klein 4B는 피부·빛에서 강했으나 그래픽·인쇄 인접 작업에서 타이포그래피를 깨뜨림. 포토리얼리즘만으로는 부족.
Z-Image Turbo 오픈 웨이트로 출시
공개 가중치는 Z-Image Turbo 머지(Diffusers transformer 또는 ComfyUI UNET 하나)이고, 한 장에 약 8 DiT 스텝을 씁니다. 베이스보다 피부·빛·텍스처를 현실적으로 맞춤. 코드가 아니라 웨이트 자체가 Apache-2.0: 사용·상업적 이용·재배포 자유.
따로 배울 런타임이 없음
표준 Diffusers 파이프라인 API의 from_pretrained로 불러오고, ComfyUI에는 병합 UNET 하나로 올라갑니다. 경로에 우리가 만든 래퍼가 없고, 가입도 키 발급도 없습니다.
터보 샘플링의 대가는 네거티브 프롬프트
8 스텝은 classifier-free guidance를 끄고서만 성립하고(guidance_scale=0, ComfyUI cfg 1), 가이던스를 끄면 네거티브 프롬프트는 아예 무시됩니다. 피하고 싶은 것도 포지티브 프롬프트에 써야 합니다. 문서로 덮을 문제가 아니라 실제 제약입니다.
강점을 명시
사진·포트레이트·무드에 강하고, 한글을 비롯한 대부분의 비라틴 문자 등 읽히는 텍스트에 약하며, 타이포 비중이 큰 그래픽·인쇄 작업은 사진 결과보다 한참 아래입니다. 선호 스터디 패턴도 같은 방향. 텍스트가 필요한 표면은 frontier API 탈출 경로를 유지.
과제
호스티드 API는 반복 실험에 너무 느림
장당 20초-3분이면 LoRA·체크포인트 스윕이 비현실적. 동일 하드웨어 조건에서 자체 서버 end-to-end 약 1.8초로 인터랙티브 베이크오프가 가능.
카테고리 셀은 검정력 부족
카테고리당 6회 비교로는 스타일별 승자를 확정할 수 없음. 출시는 전체 n=90 선호 결과만 사용. 그래픽·인쇄 셀은 동일 방향으로 실패.
한계
n=90, 내부 평가자, 단일 프롬프트 분포. 설계상 underpowered. 평가자는 시스템 구축 주체에 대해 블라인드가 아님.
성과
측정된 경로와 오픈 웨이트
44-16-30은 계속 개발의 근거이지 동등성 주장이 아님. 지연은 인터랙티브 베이크오프를 지원. 단가는 측정 가동률 50%에서 API 정가의 약 1/40(소유 하드웨어 vs 공개 가격; 가동률 의존). 가중치는 Apache-2.0이며 상업적 이용 가능.
증류이지 폐쇄 스택이 아님
속도는 Z-Image Turbo 베이스 증류에서 옴. 지속 자산은 평가 증거와 오픈 웨이트.
장당 비용
자체 서버 완전 부하 장당 비용 vs GPT Image 2 50원. 측정 가동률 50%에서 API 정가의 약 1/40. 소유 하드웨어 비용 vs 공개 가격; 동일 조건 비교 아님; 가동률 의존.
자체 서버 단가는 고정 GPU 용량이 지배. 가동률 가정 없이 숫자는 정의되지 않음.
결과물
시스템
Redrob Image
1.8s
이미지당
오픈 웨이트 Z-Image Turbo 머지(Apache-2.0, 상업적 이용 가능). g7e.2xlarge(NVIDIA RTX PRO 6000 Blackwell Server Edition, 96GB)에서 모델 상주 이후, 큐 제외 이미지당 약 1.8초. GPT Image 2 블라인드 90쌍 44-16-30(동등성 미입증). 베이스 대비 피부·빛·텍스처가 낫고 사진·포트레이트·무드에 강함. 실측 가동률 기준 단가는 API 정가의 약 1/40(동일 조건 비교 아님).