Skip to main content
MoAI-Coworker

「미디어 크리에이터」 — 이미지·영상·오디오 생성 담당

검수자 · Goos Kim · 읽는 시간 7분 · 최종 업데이트 2026.08.13

콘텐츠에 이미지·영상·음성이 들어가면 퀄리티가 확 달라집니다. 하지만 생성 도구마다 프롬프트 문법이 다르고, 계정도 따로입니다. 미디어 크리에이터는 이 멀티모달 생성을 한 코워커 안에 모아 둔 역할입니다. 스튜디오의 크리에이티브 디렉터처럼, 무엇을 만들지 정하고 알맞은 도구를 골라 호출합니다.

Higgsfield 계열(media-higgsfield-*)은 이미지·영상에 더해 3D 메시(GLB)·오디오·완성 영상 분석, 10초 블록 조립형 설명 영상, 제품 촬영 10모드, 그리고 같은 인물·캐릭터를 여러 컷에 일관되게 넣는 참조 학습(Soul / Element)까지 다룹니다. 오디오 계열(media-audio-gen)은 ElevenLabs 음성 생성을 담당합니다. 프롬프트 빌더 계열(media-gpt-image-2-prompt / media-gemini-3-image-prompt / media-midjourney-v8-prompt)은 각 모델에 맞춘 완성 프롬프트를 만들어 주고, media-notebooklm-slide-prompt는 NotebookLM Studio 슬라이드를 위한 프롬프트를 만듭니다. media-codex-image는 프롬프트가 아니라 codex CLI로 이미지를 직접 생성하는 스킬입니다(gpt-image-2, ChatGPT OAuth 인증으로 API 키 없이). 이전 버전에서 마케터로부터 미디어 생성 도메인이 분리되어 신설되었습니다. Higgsfield·ElevenLabs MCP가 연동됩니다.

브랜드 톤과 시각 일관성이 중요한 작업인 만큼, 산출물이 브랜드에 맞는지 검수하는 코워커가 붙어 있습니다.

flowchart LR
   A["요청
(제품 숏 영상 만들어줘)"] --> B["스킬 매칭"] B --> C["media-producer
이미지·영상·오디오 생성"] C --> D["media-brand-auditor
브랜드 정합 검수"] D --> E["산출물
(이미지·영상·음성)"]

스킬 카탈로그

media-* 계열 생성 스킬의 전체 목록입니다.

스킬 13종 — 아래 표는 마켓플레이스 정본(v1.2.1)에서 자동 생성됩니다.

스킬무엇을 해주나
media-audio-gen통합 오디오 생성 스킬. ElevenLabs MCP 기반 TTS(32개국어), 보이스 클로닝(1분 샘플), 다국어 더빙(립싱크), 효과음 생성을 지원. "목소리 생성", "TTS", "음성 합성", "보이스 클로닝", "더빙", "나레이션", "효과음", "AI 음성" 요청 시 사용.
media-codex-imagecodex CLI의 내장 image_gen 도구로 gpt-image-2 이미지를 생성합니다 — ChatGPT OAuth 인증으로 API 키 불필요, ChatGPT Plus/Team/Enterprise 구독 한도로 동작합니다. 다음과 같은 요청 시 사용하세요: - "codex로 이미지 만들어줘", "codex
media-gemini-3-image-promptGoogle Gemini 3 Pro Image (a.k.a. Nano Banana Pro) 전용 이미지 프롬프트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정으로 컨텍스트를 수집해 Google AI Developers 공식 가이드의 5-component 구조([Subject+Adj] doin
media-gpt-image-2-promptOpenAI GPT-image-2 모델 전용 이미지 프롬프트 텍스트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정 라운드로 컨텍스트를 수집하고, OpenAI Cookbook 공식 6-Block 구조(Subject·Action·Scene·Composition·Lighting·Style&Text
media-higgsfield-assetsHiggsfield MCP에서 이미지·영상 이외의 생성과 후처리를 다룹니다. 3D 메시(GLB) 생성·리깅·애니메이션, 오디오(효과음·앰비언스·음악·TTS), 완성 영상의 바이럴 점수 분석, 그리고 업스케일·리프레임·아웃페인팅· 배경 제거 같은 기존 에셋 후처리가 범위입니다. 다음과 같은 요청 시 사용하세요: - "이 사
media-higgsfield-coreHiggsfield MCP 이미지·영상 생성의 공유 코어. media-higgsfield-image / media-higgsfield-video가 로드하는 SSOT(single source of truth)로, 호출 스키마·라이브 카탈로그 조회 프로토콜·공통 크래프트 규칙(R1–R5)·인터뷰 슬롯·잡 수명주기를 정의합니다
media-higgsfield-explainerHiggsfield MCP로 내레이션이 깔린 비실사 설명 영상을 만듭니다. 10초 블록 단위로 내레이션 한 줄과 영상 한 컷을 짝지어 만든 뒤, 서버에서 순서대로 조립해 완성 MP4를 반환합니다. 다음과 같은 요청 시 사용하세요: - "이 주제로 설명 영상 만들어줘" - "이 문서를 나레이션 영상으로" - "얼굴 안 나오
media-higgsfield-identityHiggsfield MCP에서 재사용 가능한 인물·사물 일관성 참조를 만듭니다. Soul Character(학습형 identity 모델)와 Reference Element(즉시 생성형 참조) 중 어느 쪽을 써야 하는지 판정하고, 선택된 경로로 생성·조회합니다. 다음과 같은 요청 시 사용하세요: - "내 얼굴로 Soul 만
media-higgsfield-imageHiggsfield MCP 기반 AI 이미지를 자연어 요청 한 줄로 생성합니다. 모델·파라미터를 하드코딩하지 않고 라이브 카탈로그(models_explore)를 조회해 호출하므로, 카탈로그가 바뀌어도 드리프트 없이 동작합니다. 다음과 같은 요청 시 사용하세요: - "Higgsfield로 이미지 만들어 줘" - "Soul로
media-higgsfield-product브랜드·제품 비주얼 요청을 10개 촬영 모드 중 하나로 판정하고, 그 모드에 맞는 프롬프트 구조를 조립해 Higgsfield MCP로 이미지를 생성합니다. 스튜디오 컷·라이프스타일·핀터레스트 핀·히어로 배너·캐러셀· 광고 크리에이티브 팩·가상 피팅·컨셉추얼·리스타일이 범위입니다. 다음과 같은 요청 시 사용하세요: - "제
media-higgsfield-videoHiggsfield MCP 기반 AI 영상을 자연어 요청 한 줄로 생성합니다. 모델·파라미터를 하드코딩하지 않고 라이브 카탈로그(models_explore)를 조회해 호출하므로, 카탈로그가 바뀌어도 드리프트 없이 동작합니다. 다음과 같은 요청 시 사용하세요: - "Higgsfield 영상 만들어줘" - "Veo로 영상"
media-midjourney-v8-promptMidjourney v8.1 (2026.03 Alpha) 전용 이미지 프롬프트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정으로 컨텍스트를 수집해 Midjourney 공식 Parameter List 기반 키워드+`--파라미터` 형식으로 변환합니다. Discord `/imagine` 또는 al
media-notebooklm-slide-prompt강연·강의·세미나 본문 마크다운을 입력받아 (1) NotebookLM Studio에 그대로 붙여 넣을 슬라이드 데크 생성 프롬프트와 (2) 슬라이드별 나노바나나(Gemini 3 Pro Image, a.k.a. Nano Banana Pro) 5-Component 이미지 프롬프트를 동시 산출하는 prompt-builder 스

에이전트

media-producer(실행 코워커)가 이미지·영상·오디오를 생성하고, media-brand-auditor(검수 코워커)가 산출물이 브랜드 톤·일관성 기준에 맞는지 검수합니다.

에이전트역할유형
media-brand-auditormoai-media 플러그인의 읽기 전용 회의적 검수자. media-producer 또는 media-* 스킬이 생성한 이미지·영상·오디오 자산과 생성 프롬프트를 독립적으로 평가합니다. 브랜드/스타일 일치, 저작권·라이선스 위험, 프롬프트 인젝션/안전하지 않은 콘텐츠 위험, 프롬프트 엔지니어링 품질을 점검합니다. 증거 기반 PASS/FAIL 판정을 반환하며,검수 (읽기 전용)
media-producermoai-media 플러그인의 멀티모달 미디어 생성 프로듀서. 이미지·영상·오디오 생성 — Higgsfield 이미지/영상, ElevenLabs TTS/보이스클로닝/더빙, GPT-image-2/Gemini 3/Midjourney v8/codex/NotebookLM 슬라이드용 빌드 프롬프트 — 을 요청할 때 사용합니다. 이 플러그인의 media-* 스킬 집합실행 (worker)

대표 시나리오 5선

1. Higgsfield 시네마틱 숏. “이 제품 15초 시네마틱 숏으로 만들어줘"라고 하면 media-higgsfield-video가 Higgsfield MCP로 영상을 생성합니다. 사전에 예상 크레딧을 고지합니다.

2. 이미지 프롬프트 빌드. “이 캠페인 키비주얼을 GPT-image와 Midjourney용 프롬프트로 뽑아줘"라고 하면 media-gpt-image-2-prompt·media-midjourney-v8-prompt가 각 모델에 맞춘 완성 프롬프트를 제공합니다.

3. 음성 광고 제작. “20초 음성 광고 스크립트 음성으로 만들어줘"라고 하면 media-audio-gen이 ElevenLabs로 음성을 생성합니다.

4. 캐릭터 일관성 확보. “이 캐릭터가 모든 컷에 똑같이 나오게 해줘"라고 하면 media-higgsfield-identity가 먼저 경로를 가릅니다. 한 사람을 단독으로 쓰면 Soul 학습(사진 5~20장, 약 10분), 두 명 이상이 한 컷에 나오거나 제품·배경이면 Element입니다. 한 생성에 Soul은 하나만 들어가므로, 2인 컷은 Soul로 만들 수 없습니다. 판정이 애매하면 학습을 시작하지 않고 되묻습니다.

5. 설명 영상 제작. “이 주제로 3분짜리 내레이션 영상 만들어줘"라고 하면 media-higgsfield-explainer가 10초 블록 18개로 나눠 내레이션과 화면을 1:1로 짝지어 만든 뒤 서버에서 조립합니다. 스타일을 먼저 고르고 나머지 설정을 정하는 2단계 질문 순서를 지킵니다.

잘 안 될 때 — Higgsfield 생성 실패 시 프롬프트 온리 폴백으로 전환합니다. OAuth 인증은 Higgsfield MCP 설정을 참고하세요.

MCP 연동

  • higgsfield — 이미지·영상 생성. Higgsfield OAuth 인증이 필요합니다 (설정 가이드).
  • ElevenLabs — 텍스트 음성 변환·보이스 클로닝. ElevenLabs API 키가 필요합니다.