프로젝트
Redrob Studio
명시적 콘텐츠 모더레이션 정확도 99.92% (n = 6,000)
TP 2,995 · FP 5 · FN 0 · TN 3,000. 재현율 100%, 정밀도 99.83%. 프롬프트는 LLM, 출력은 VLM. 브라우저는 Next.js만 보고, Next.js는 서버 전용 COMFYUI_URL로 ComfyUI에 붙습니다. 이미지: Create(Redrob Image), Upscale, Compress, Convert, Vision. 오디오: Speak, Clone, Design, Music(Tune/ACE-Step), Transcribe, Extract(비디오 파일에서 오디오 추출), Convert. 베이크오프는 같은 셸.
요약
자체 ComfyUI GPU 위의 로컬 Next.js 스튜디오입니다. 이미지·오디오 툴 매트릭스와 LLM·VLM 이중 안전 게이트를 갖췄고, 이미지·텍스트·오디오 6,000건 NSFW/SFW 평가에서 정확도 99.92%, 재현율 100%를 기록했습니다. 채팅 화면도 비디오 생성 스택도 없습니다. 홈은 툴 카탈로그이고 베이크오프는 같은 셸에 있습니다. 지연·선호 주장은 Image·Tune에 둡니다.
담당
ComfyUI 클라이언트, LLM·VLM 이중 안전 검사, 툴 매트릭스, 비교 UI를 약 3주간 혼자 만들었습니다. Image·Tune이 뒤쪽 모델을 공급합니다.
목적
통제 가능한 ComfyUI 위에서 생성 워크플로를 호출하고, 이미지·오디오 툴 매트릭스를 한 화면에 두며, 체크포인트·LoRA를 스프레드시트가 아니라 도구 안에서 비교하고, 측정된 catch rate로 명시적 콘텐츠를 제품 경로 밖으로 걸러내는 로컬 클라이언트.
데모
Studio 워크스루
Create, tools, 베이크오프를 한 클라이언트에. 일반 ComfyUI와 이중 안전 게이트.
안전 스터디
Studio의 제품 주장은 선호도가 아니라 모더레이션입니다. 생성 전에는 LLM이 프롬프트를 검토하고, 완성된 결과물은 VLM이 검토합니다. 아래 수치는 이미지, 텍스트, 오디오 생성을 아우르는 라벨링된 NSFW / SFW 프롬프트 세트에서 나온 것입니다.
설계
- 프롬프트 총 6,000개
- 세 modality: 이미지 생성, 텍스트 생성, 오디오 생성
- modality당 NSFW 1,000 · SFW 1,000
- 출처: NSFW·SFW 모두 AI 생성과 사용자 수집
- 양성 클래스: 차단해야 할 명시적 / NSFW 콘텐츠
- 이중 게이트: 프롬프트는 LLM, 출력은 VLM
AI 생성 프롬프트와 사용자 수집 프롬프트를 함께 포함해, 게이트가 특정 프롬프트 방언에만 맞춰지지 않도록 했습니다. 이미지, 텍스트, 오디오가 같은 모더레이션 주장을 공유하는 이유는 Studio가 세 가지 모두를 동일한 클라이언트 경로로 처리하기 때문입니다.
혼동 행렬
- 진양성 (TP)
- 2,995
- 위양성 (FP)
- 5
- 위음성 (FN)
- 0
- 진음성 (TN)
- 3,000
- 정확도
- 5,995 / 6,000 = 99.92%(TP + TN) / n
- 재현율
- 2,995 / 2,995 = 100%TP / (TP + FN) · NSFW 미검출 없음
- 정밀도
- 2,995 / 3,000 = 99.83%TP / (TP + FP)
결정
프롬프트는 LLM, 출력은 VLM
텍스트 안전과 이미지·오디오 안전은 실패 모드가 다릅니다. 생성 전에는 LLM이 프롬프트를 검사하고, 완성된 결과물은 VLM이 검사합니다. 6,000개 프롬프트 세트에서 이 이중 경로로 정확도 99.92%, 위음성 0을 달성했습니다.
서버 전용 URL 뒤의 일반 ComfyUI
브라우저는 ComfyUI에 직접 붙지 않습니다. 워크플로는 allowlist 템플릿으로 서버에서 조립하고, 진행은 SSE로 중계합니다. 체크포인트·LoRA 교체는 통제 GPU 위 그래프 변경입니다.
전체 툴 매트릭스, 셸은 하나
이미지·오디오 툴이 하나의 Next.js 표면과 같은 안전 게이트를 공유해서, 한 작업을 끝내려고 앱을 옮겨 다니지 않아도 됩니다. Create는 Redrob Image로, Music은 Studio 안에서만 공개한 Redrob Tune으로 돕니다. 베이크오프는 제품 안에서 모델을 비교하고, 지연·선호 주장은 Image·Tune에 둡니다.
기본 설정은 출발점이지 잠금이 아니다
직접 만든 체크포인트나 LoRA를 넣고 지금 쓰는 것과 같은 프롬프트로 돌려서, 두 결과를 나란히 본 다음에 정하면 됩니다. 비교가 도구 안에서 일어나야 사람들이 실제로 비교합니다.
GPU가 없으면 출력도, 조용한 폴백도 없다
GPU 호스트를 붙이지 않으면 UI는 열리지만 어떤 도구도 출력을 만들지 않습니다. 대신 돌아 주는 클라우드 경로가 없기 때문이고, 설정 문제가 아니라 설계상의 조건입니다. Create는 Redrob Image의 한글·타이포 한계도 그대로 물려받습니다.
과제
약 43만 원으로 3주간 혼자 개발
범위: ComfyUI 클라이언트, 이중 안전 검사, 툴 카탈로그, 실시간 진행, 모델 비교용 베이크오프 UI.
모델 라인은 여러 개, UI는 하나
Image와 Tune은 UI·모더레이션은 공유하지만 주장은 공유하지 않습니다. 클라이언트는 Speech가 추가돼도 무리 없을 만큼 modality-agnostic해야 했습니다.
성과
정확도 99.92%, NSFW 미검출 0
이미지·텍스트·오디오 라벨 프롬프트 6,000개에서 이중 게이트는 위양성 5건, 위음성 0건을 기록했습니다. 선호도와 지연 관련 내용은 Image와 Tune 페이지에 남겨뒀습니다.
모델이 충분히 빨라진 뒤의 인터랙티브 비교 실험
Image가 초 단위 구간에 들어오고 Tune이 분 단위 오디오를 수십 초 만에 만들어내면서, 비교 UI를 밤새 돌리는 배치 작업이 아니라 실시간 선호도 평가 작업으로 쓸 수 있게 되었습니다.
시스템
Redrob Studio
99.92%
안전 정확도 (n=6000)
일반 ComfyUI(서버 전용 COMFYUI_URL) 위의 로컬 Next.js 클라이언트. 프롬프트는 LLM, 출력은 VLM. 이미지·텍스트·오디오 NSFW/SFW 6,000건에서 정확도 99.92%(TP 2995, FP 5, FN 0, TN 3000). 채팅 화면과 비디오 생성 스택 없이 이미지·오디오 툴 매트릭스와 bake-off.
웹 앱이 서버 전용 URL로 ComfyUI 워크플로를 호출하고 진행 상황을 스트리밍하며, 프롬프트에는 LLM을, 완성된 출력에는 VLM을 적용합니다 모델·LoRA bake-off
bake-offs
비교 UI
체크포인트와 LoRA를 나란히 비교하는 Studio 내 선호도(preference) 테스트 기능입니다.
화면
Create
메인 생성 화면입니다. 프롬프트를 입력하고 Fast 또는 Best 모드를 선택한 뒤 Redrob Image(또는 다른 외부 클라우드 Redrob 모델)를 실행합니다. 생성 전에 LLM이 프롬프트를 검토해 안전하지 않은 요청을 미리 차단할 수 있습니다.
Tools
비디오 생성과 얼굴·배경 편집이 아직 남아 있던 이전 빌드의 툴 카탈로그입니다. 실제 배포한 도구는 이미지와 오디오뿐입니다: Create, Upscale, Compress, Convert, Vision; Speak, Clone, Design, Music, Transcribe, Extract(오디오 추출), Convert.
스튜디오 내 bake-off
모델과 프롬프트를 나란히 비교합니다. Image·Tune 설정은 이 단계에서 평가받습니다.