프로젝트

Redrob Image

블라인드 90쌍 44-16-30(내부 평가자)

n=90에서 구간은 대략 ±10포인트: 큰 격차 배제, 동등성 미입증. 공개 주장용이 아니라 계속 개발 여부를 위한 결정 연구. 지연은 g7e.2xlarge 1대(NVIDIA RTX PRO 6000 Blackwell Server Edition, 96 GB; 모델 상주, 큐 제외)에서 end-to-end 약 1.8초. Studio가 클라이언트이고, 이 페이지는 모델 경로를 다룹니다.

요약

오픈 웨이트 Z-Image Turbo 머지(Apache-2.0, 상업적 이용 가능). 일반 디퓨전 모델이 30~50 스텝을 쓰는 자리에서 약 8 DiT 스텝에 한 장을 끝냅니다. 표준 Diffusers 파이프라인이나 병합 ComfyUI UNET 하나로 돌고, 빌린 클러스터가 아니라 소비자용 GPU 한 장이 기준입니다. GPT Image 2 대비 블라인드 선호 44-16-30(n=90, 내부 평가자). 큰 격차 배제, 동등성 미입증. 베이스 대비 피부·빛·텍스처가 낫고 사진·포트레이트·무드에 강하며, 한글을 비롯한 비라틴 문자 등 읽히는 텍스트에는 약합니다. g7e.2xlarge 1대(NVIDIA RTX PRO 6000 Blackwell Server Edition, 96 GB; 모델 상주, 큐 제외)에서 end-to-end 장당 약 1.8초. 측정 가동률 50% 기준 완전 부하 단가는 API 정가의 약 1/40(소유 하드웨어 비용 vs 공개 가격; 가동률 의존). 아래 샘플은 Redrob Image 출력입니다.

담당

모델 선정(Z-Image Turbo 오픈 웨이트), 블라인드 선호 설계, Studio 베이크오프 운영을 담당. 호스팅은 Studio 셸과 공유.

목적

인터랙티브 베이크오프가 가능한 지연과, 강한 호스티드 베이스라인 대비 선호에서 계속 개발할 근거가 되는 Apache-2.0 오픈 웨이트 이미지 모델. 사용·상업적 이용·재배포 자유이고, 소비자용 GPU 한 장이 차선책이 아니라 기준이 될 만큼 가볍게 만듭니다.

선호도 스터디

Redrob Image vs GPT Image 2 블라인드 일대일 선호(n=90). 맥락: frontier API 요금과 장당 20-180초 지연. 기준: 방어 가능한 단가에서의 제품 적합도. 결과가 Studio의 프로덕션 이미지 모델을 결정.

설계

  • GPT Image 2와 일대일 비교; 무승부 허용
  • 평가자·실험자 모두 시스템 신원에 블라인드
  • 수집 전 고정 프롬프트 카테고리 15개; 카테고리당 6회(총 90회)
  • 독립 2라운드; 라운드마다 평가자·프롬프트 세트 상이
  • 공개 벤치마크가 아닌 제품 분포에서 추출한 프롬프트
  • 예산 50만 원; 기간 3주

2라운드는 1라운드 재평가가 아님. 평가자와 프롬프트가 모두 다른 독립 반복 2회.

무승부 17.8%. 승패로 강제하면 존재하지 않는 신호를 만듦.

실험자 블라인드는 프롬프트 선택, 제시 순서, 연구 중 판단을 제약.

결과

Redrob Image 승
44
무승부
16(17.8%)
GPT Image 2
30
무승부 제외
44/74 = 59.5%95% CI [47.4%, 70.7%] · p = 0.130 · Clopper-Pearson
무승부 분할
52/90 = 57.8%p = 0.140
무승부를 패로 처리
44/90 = 48.9%95% CI [38.2%, 59.7%] · p = 0.916 · Clopper-Pearson

블라인드 90쌍 44-16-30(내부 평가자). 이 n에서 구간은 대략 ±10포인트: 큰 격차 배제, 동등성 미입증. 공개 주장용이 아니라 계속 개발 여부 결정용. 무승부 제외 59.5%, 95% CI [47.4%, 70.7%], p = 0.130: 구간이 50%를 포함. 무승부 처리 3가지 모두 동일하게 비동등.

한계

n=90, 내부 평가자, 단일 프롬프트 분포. 설계상 underpowered. 평가자는 시스템 구축 주체에 대해 블라인드가 아님.

지는 부분

가장 약한 카테고리(Redrob Image : 무승부 : GPT Image 2; 각 6회):

Risograph 그래픽 일러스트
1 : 0 : 5
픽셀아트 / 포토리얼 합성
2 : 0 : 4
그래픽 디자인, 하프톤 텍스트 오버레이
2 : 0 : 4
빈티지 테크니컬러 필름
1 : 1 : 4

가장 강한 카테고리(대조):

드라마틱 포트레이트
5 : 0 : 1
다크 무드 디지털 아트
5 : 1 : 0
아날로그 흑백 포트레이트
4 : 2 : 0
이중노출 합성
4 : 1 : 1

사진·포트레이트는 Redrob Image, 그래픽·인쇄·텍스트 포함은 GPT Image 2 쪽. 이 패턴이 라우팅을 결정. 셀 단위로는 미입증.

카테고리 의존성 omnibus: p = 0.096(시사적, 비유의). 개별 카테고리는 15검정 Bonferroni를 통과하지 못함. 셀당 6회면 6-0도 p = 0.031, 보정 α = 0.0033. 이 설계로는 유의한 단일 카테고리 결과가 구조적으로 불가능. 표본 크기 설계의 결함이지 모델 속성이 아님. 셀 패턴은 라우팅 참고용이며 확정 발견이 아님.

15개 카테고리를 사후 그룹으로 묶으면 패턴이 결정적으로 보임. 그룹은 사전 지정이 아니므로 해당 p-value는 보고하지 않음. 카테고리는 사전 고정, 그룹은 비고정.

텍스트 렌더링이 운영 규칙을 결정. 직접 증거는 얇음(하프톤-텍스트 2-0-4, p = 0.69). 근거는 인접 그래픽·인쇄 셀의 방향 수렴과 이 계열 모델의 알려진 구조적 실패 모드이지, 유의한 셀 결과가 아님.

운영 규칙: 가독 텍스트가 필요한 표면은 frontier API로 라우팅.

바꾸고 싶은 점

  • 카테고리당 6회로는 단일 카테고리 주장이 구조적으로 불가능. 유용한 최소 셀 크기: 10.
  • 라운드 간 평가자 겹침 없음: inter-rater reliability 계산 불가, 평가자 효과와 프롬프트 세트 효과 혼동. 공유 앵커 5문항이면 거의 무비용으로 해결 가능했음.
  • 동등성 검정력 부족. ±10포인트·80% power에 155회, ±5에 619회. 현재 데이터는 최대 ±19포인트 마진까지.
  • 카테고리 그룹은 사전 지정했어야 함. 없으면 그룹 패턴은 가설이지 발견이 아님.
  • 확정용 재실행: 현재의 약 5배(평가자 병렬 시 약 250만 원, 3-4주).

오픈 웨이트는 Apache-2.0이며 상업적 이용이 가능합니다. 속도는 Z-Image Turbo 증류에서 옴. 지속 자산은 평가 증거와 가중치.

결정

  • 자연어 해부학을 위해 Stable Diffusion 폐기

    Stable Diffusion을 Klein 4B, Z-Image Turbo와 비교. SD는 깨끗한 해부학에 좁은 프롬프트 방언이 필요하고, 일반 언어에서는 실패. 그 방언은 수용 불가.

  • 포토리얼리즘에도 불구하고 Klein 기각

    Klein 4B는 피부·빛에서 강했으나 그래픽·인쇄 인접 작업에서 타이포그래피를 깨뜨림. 포토리얼리즘만으로는 부족.

  • Z-Image Turbo 오픈 웨이트로 출시

    공개 가중치는 Z-Image Turbo 머지(Diffusers transformer 또는 ComfyUI UNET 하나)이고, 한 장에 약 8 DiT 스텝을 씁니다. 베이스보다 피부·빛·텍스처를 현실적으로 맞춤. 코드가 아니라 웨이트 자체가 Apache-2.0: 사용·상업적 이용·재배포 자유.

  • 따로 배울 런타임이 없음

    표준 Diffusers 파이프라인 API의 from_pretrained로 불러오고, ComfyUI에는 병합 UNET 하나로 올라갑니다. 경로에 우리가 만든 래퍼가 없고, 가입도 키 발급도 없습니다.

  • 터보 샘플링의 대가는 네거티브 프롬프트

    8 스텝은 classifier-free guidance를 끄고서만 성립하고(guidance_scale=0, ComfyUI cfg 1), 가이던스를 끄면 네거티브 프롬프트는 아예 무시됩니다. 피하고 싶은 것도 포지티브 프롬프트에 써야 합니다. 문서로 덮을 문제가 아니라 실제 제약입니다.

  • 강점을 명시

    사진·포트레이트·무드에 강하고, 한글을 비롯한 대부분의 비라틴 문자 등 읽히는 텍스트에 약하며, 타이포 비중이 큰 그래픽·인쇄 작업은 사진 결과보다 한참 아래입니다. 선호 스터디 패턴도 같은 방향. 텍스트가 필요한 표면은 frontier API 탈출 경로를 유지.

과제

  • 호스티드 API는 반복 실험에 너무 느림

    장당 20초-3분이면 LoRA·체크포인트 스윕이 비현실적. 동일 하드웨어 조건에서 자체 서버 end-to-end 약 1.8초로 인터랙티브 베이크오프가 가능.

  • 카테고리 셀은 검정력 부족

    카테고리당 6회 비교로는 스타일별 승자를 확정할 수 없음. 출시는 전체 n=90 선호 결과만 사용. 그래픽·인쇄 셀은 동일 방향으로 실패.

  • 한계

    n=90, 내부 평가자, 단일 프롬프트 분포. 설계상 underpowered. 평가자는 시스템 구축 주체에 대해 블라인드가 아님.

성과

  • 측정된 경로와 오픈 웨이트

    44-16-30은 계속 개발의 근거이지 동등성 주장이 아님. 지연은 인터랙티브 베이크오프를 지원. 단가는 측정 가동률 50%에서 API 정가의 약 1/40(소유 하드웨어 vs 공개 가격; 가동률 의존). 가중치는 Apache-2.0이며 상업적 이용 가능.

  • 증류이지 폐쇄 스택이 아님

    속도는 Z-Image Turbo 베이스 증류에서 옴. 지속 자산은 평가 증거와 오픈 웨이트.

장당 비용

자체 서버 완전 부하 장당 비용 vs GPT Image 2 50원. 측정 가동률 50%에서 API 정가의 약 1/40. 소유 하드웨어 비용 vs 공개 가격; 동일 조건 비교 아님; 가동률 의존.

GPU 가동률장당 비용배율
25%2원20x
50% (측정)1원40x
80%1원 미만64x

자체 서버 단가는 고정 GPU 용량이 지배. 가동률 가정 없이 숫자는 정의되지 않음.

결과물

시스템

  • Redrob Image

    1.8s

    이미지당

    오픈 웨이트 Z-Image Turbo 머지(Apache-2.0, 상업적 이용 가능). g7e.2xlarge(NVIDIA RTX PRO 6000 Blackwell Server Edition, 96GB)에서 모델 상주 이후, 큐 제외 이미지당 약 1.8초. GPT Image 2 블라인드 90쌍 44-16-30(동등성 미입증). 베이스 대비 피부·빛·텍스처가 낫고 사진·포트레이트·무드에 강함. 실측 가동률 기준 단가는 API 정가의 약 1/40(동일 조건 비교 아님).