로컬에서 배우는 AI 무엇을 고쳤나 말고, 어떻게 틀린 줄 알았나를 적는다

부서

영상

쇼츠·스토리 영상. 판수가 곧 비용이라 프롬프트를 늘리지 않는다

영상은 판수가 비용이다. 이 저장소의 생성기는 한 판에 10분 00초가 걸리고(웜 3판 601·600·600초, 분산 1초) 하룻밤에 약 54판이 한계다. 그래서 "몇 판 더 돌려 본다"가 전략이 될 수 없다.

이 부서가 다섯 번 반복해서 확인했다. 프롬프트로 안 되는 것은 프롬프트를 늘려도 안 된다. 흰 연기를 검은 연기로 24판, 감염자 자세 20판, 상처 위치 22판, 얼굴 열상 18판, 낮 색보정 34판 — 전부 실패했고 전부 픽셀 합성으로 뚫었다. 밤 전환도 같았다. 변형 강도를 0.30에서 0.60까지 올려도 파란 하늘 비율은 24.5%에서 24.9%로 안 줄고 구조 유사도만 0.808에서 0.643으로 무너졌다. 먼저 픽셀로 밤을 만들어 두면 0.26에서 성립했다.

부정문은 더 나쁘다. "점이 없다"는 조항 하나를 지우니 흰 점이 81개에서 1개로 줄었다 — 모델은 그 문장을 금지가 아니라 소재로 읽는다. 같은 이유로 동작 지시를 전부 긍정문으로 뒤집었다. "팔을 흔들지 않는다"가 아니라 "팔이 죽은 무게로 매달린다".

프롬프트도 줄이는 방향으로 갔다. 603단어를 349~382단어로, 부정어 1,133자를 320자로. 교차주의가 512토큰 길이로 학습돼 있어 그 밖에 적은 문장은 힘이 빠지기 때문이다.

배경 고증도 프롬프트로 억제하려다 두 번 실패했다. "강남처럼 안 보인다"의 원인은 카메라 높이가 아니라 간판 달린 중층 상가 파사드였다. 실제 규격(왕복 10차로·폭 50m)을 조사해 장면 계약에 못 박고서야 닫혔다. 지금은 컷마다 장소·화면비·카메라·인물 고정을 검사한다. 검사기를 넣자마자 6컷이 더 걸렸다.

이 부서가 나온 기록 13

  1. 척추 이야기를 한 줄도 안 썼더니 전부 구부정하게 나왔다 — 프롬프트가 침묵한 축은 모델 기본값이 채운다
  2. 세로로 만들어 두면 가로는 잘라 쓰면 된다고 믿었다 — 화면비 한 줄이 완성본 22컷을 죽인 날
  3. 워크플로 파일 이름은 사양이 아니다 — FL2VA 라고 적힌 아홉 컷 중 일곱이 I2VA 로 돌았다
  4. 이미지를 다시 굽지 않고 프롬프트를 이미지에 맞췄다 — 한 줄을 고치자 세 곳이 무너진 연쇄
  5. no specks 라고 썼더니 흰 점이 수십 개 나왔다 — 이미지 프롬프트에서 부정문이 그리는 것
  6. 실제 장소를 프롬프트로 열 번 만들려다 졌다 — 사진을 크롭해서 인페인트로 돌린 이유
  7. 지표 두 개가 정반대 판정을 냈다 — 생성 영상의 얼굴 붕괴를 무엇으로 재야 하나
  8. 영상 자막에서 한글만 안 나왔다 — 인코딩이 아니라 TTC 폰트의 face index 를 안 준 것이었다
  9. 동작은 영상에서 짜낼 수 없다 — 키프레임이 전부 누운 자세면 보간 모델은 아무것도 못 만든다
  10. 제약을 나중에 만나지 말고 먼저 만난다 — 30분 영상을 기획하며 순서를 네 번 바꾼 기록
  11. 이미지 ControlNet 관례 "가까울수록 밝다"를 영상에 그대로 옮겼다 — 극성을 뒤집자 실루엣이 사람이 됐다
  12. 프롬프트를 다섯 번 고쳐 썼는데 자세는 한 번도 안 바뀌었다 — 그리고 그게 왜 당연했나
  13. 세 번 다 "느낌"이 틀렸다 — 로컬 제작에서 재는 것이 도구 선택보다 먼저인 이유