← 블로그로
Ai약 12 분 읽기

그리면 나타난다: 낙서로 객체를 편집하는 시대가 열리다

게시일 2026년 10월 10일
그리면 나타난다: 낙서로 객체를 편집하는 시대가 열리다

10월 초 Hugging Face 어딘가에서, 작은 연구 결과물 하나가 이미지 편집이 어디로 향하는지를 조용히 보여주었다. ML-Intern-lab의 한 팀은 알리바바의 Qwen-Image-2.1용 LoRA를 공개했는데, 이름은 Doodle-in이다. 사진을 하나 고르고, 바꾸고 싶은 영역 위에 대충 마젠타색 낙서를 그리고, 객체의 이름을 말하면, 모델은 조명과 나머지 장면은 그대로 둔 채 낙서 아래에 있던 것을 교체한다. 이 모델은 Open Images V7로 만든 6,000쌍이 조금 넘는 데이터로 학습되었다.

이것은 이름도 화려하지 않은 틈새 도구다. 동시에 올 한 해 내내 쌓여온 변화, 즉 이미지 AI에서 흥미로운 부분이 생성에서 편집으로 옮겨갔다는 변화를 깔끔하게 보여주는 사례다.

진짜 작업은 결코 첫 이미지가 아니었다

이미지 모델을 직업으로 쓰는 사람에게 실제로 시간을 어디에 쓰는지 물어보라. 답은 좀처럼 첫 렌더링이 아니다. 두 번째, 세 번째, 열두 번째 수정이다. 병에 붙은 라벨을 바꾼다. 사람 얼굴은 유지한다. 그림자를 바꾸지 않고 제품을 왼쪽으로 2인치 옮긴다. 옷깃은 건드리지 않고 재킷을 다른 배경에 올린다.

이런 편집 때문에 아름다운 이미지를 만들어내는 생성기와 디자이너가 넘겨줄 수 있는 도구는 다르다. 그 간극은 통제력이며, 시장 전체가 그 통제력을 중심으로 재편되어 왔다. OpenAI는 대표 이미지 모델을 빠른 계층과 정밀한 계층으로 나누고, 정밀한 쪽을 얼굴, 라벨, 레이아웃을 정확히 유지하는 편집용으로 내세웠다. Seedream의 Pro 모델은 프레임의 나머지는 유지하면서 한 요소만 편집하는 점을 강조했다. Ideogram 4.5는 반복 편집 후 아티팩트가 누적되는 특정 문제를 중심으로 만들어졌다. Grok의 이미지 모델은 “편집이 진짜 작업이다”라는 말을 전체 제안의 프레임으로 삼았다.

어두운 사진 위의 마젠타색 마커 영역이 새로운 객체로 변하는 모습

왜 낙서가 문단보다 나은가

국소 편집을 말로 설명하는 것은 보기보다 어렵다. “왼쪽 선반 위의 식물을 더 작은 것으로 바꿔줘”라고 하면 모델이 왼쪽 전체를 재해석하거나, 조명을 조정하거나, 선반을 조용히 다시 렌더링하도록 유도한다. 언어로 더 정확해지려고 할수록, 모델이 당신이 언급하지 않은 무언가를 바꿀 수 있는 표면적이 더 커진다.

낙서는 그 모호함을 없앤다. 그것은 가리킨다. 영역을 그리고, 객체를 이름 붙이면, 지시는 문단 대신 두 개의 입력으로 축약된다. 구현이 까다로운데도 이 기법이 퍼지는 이유다. 시각 작업에서 가장 오래된 상호작용인 손을 빌려와, 언어가 잘 맞지 않는 곳에 사용한다.

실용적인 사례, 특히 제품에서

국소 편집은 반복이 많은 곳에서 가장 중요하다. 제품 카탈로그는 같은 품목을 수십 개 맥락에서 보여줘야 하고, 각 맥락은 일관된 조명과 재질을 가져야 한다. 캠페인을 각 시장에 맞게 바꾸는 에이전시는 재촬영 없이 히어로 이미지 하나를 조정해야 한다. 인디 디자이너는 이미 맞게 나온 부분을 다시 생성하지 않고 레이아웃을 반복 수정해야 한다.

각 경우에서 가치는 창의성이 아니다. 처음부터 다시 시작하지 않아도 된다는 점이다. 그것은 좋은 데모는 되지 못하지만 예산에는 분명히 나타나는 종류의 가치다.

이 패턴은 주목할 만한데, 대부분의 사람이 이 도구들을 처음 배우는 방식과 어긋나기 때문이다. 초보자는 긴 프롬프트를 쓰고 기대한다. 직업으로 하는 사람은 짧게 지시하고 가리킨다. 모델에게 바꾸라고 요청하는 것이 적을수록, 원하지 않은 것도 덜 바뀐다는 걸 배웠기 때문이다. 낙서는 그 습관이 인터페이스가 된 것이며, 그래서 기능이라기보다 이 작업이 늘 어떻게 이루어졌는지에 대한 고백처럼 느껴진다.

이걸 제대로 해내는 도구는 대개 과정 속으로 사라진다. 아무도 자기 하루를 “국소 편집기를 썼다”라고 설명하지 않는다. “라벨을 고치고 배치를 출하했다”라고 말한다. 편집 도구가 그 지점에 도달하면 제 역할을 다한 것이고, 이름도 어색한 연구용 LoRA가 거기에 도움을 줬다는 사실은 이야기에서 가장 흥미롭지 않은 부분이다.

이 기법이 시사하는 다른 것들

낙서는 여러 입력 중 하나일 뿐이고, 흥미로운 질문은 주어진 작업에 어떤 입력이 필요한가이다. 변화가 공간적이고 국소적이면, 설명보다 가리키는 것이 낫다. 변화가 스타일적이고 전역적이면 참조 이미지가 둘 다보다 낫다. 그래서 올해의 많은 발전이 더 긴 프롬프트 대신 모델에 더 많은 참조를 먹이는 쪽으로 이루어졌다. 변화가 미묘하고 전체 이미지가 안정적으로 유지되어야 한다면, 마스크와 정밀한 지시가 여전히 이긴다. 기술은 이 중 하나를 마스터하는 것이 아니다. 어느 것이 맞는지 아는 것이다.

사람과 모델이 노동을 나누는 방식에 대한 더 깊은 요점도 있다. 모델은 그럴듯한 이미지를 만드는 데 능하고, 어떤 이미지가 맞는지는 잘 모른다. 낙서는 사람이 모델이 추론할 수 없는 부분, 즉 의도를 제공하고, 모델은 잘하는 부분, 즉 합성을 하도록 남겨둔다. 그 분업 덕분에 이 기법은 거의 즉시 자연스럽게 느껴진다. 새로운 인터페이스가 아니다. 오래된 인터페이스인 손을, 언어가 계속 실패해 온 곳에 적용한 것이다.

같은 논리는 올해 출시된 도구들 전반에서 나타난다. Magnific One은 바로 이 이유로 생성 전에 아트 디렉션 단계를 추가했다. 방향을 정하는 것은 인간의 행위이고, 미리 해두면 모델이 추측할 필요가 줄어든다. 낙서는 몇백 픽셀 규모에서 같은 아이디어다.

편집 도구에 대한 짧은 현장 안내

주어진 편집에 무엇을 쓸지 고르고 있다면, 대략적인 순서가 도움이 된다. 영역을 가리킬 수 있는 국소 변경에는 낙서나 마스크 도구를 써라. 그것이 줄 수 있는 가장 모호하지 않은 지시다. 분위기, 조명, 스타일에 대한 전역 변경에는 참조 이미지를 쓰고 모델이 그것에 맞추게 하라. 다른 무엇도 건드리지 않아야 하는 변경에는 반복 편집 전반의 일관성을 광고하는 도구를 찾아라. 그것이 필요한 속성이고, 대부분의 도구가 가장 약한 부분이다. 그리고 클라이언트에게 전달할 작업이라면 결과에 반하기 전에 라이선스 문제를 정리하라.

솔직하게 짚어야 할 부분들

낙서-투-오브젝트 편집은 마법이 아니고, 실패 방식은 예측 가능하다. 가림이 어려운 경우다. 바꾸고 싶은 객체가 다른 것 뒤에 있거나 부분적으로 가려져 있으면, 모델은 빠진 부분을 상상해야 하고, 때때로 잘못 상상한다. 반복 편집은 여전히 흐트러지며, 그래서 여러 연구소가 건드리지 않은 픽셀을 안정적으로 유지하는 수정을 내놓고 있다.

확인해볼 만한 라이선스 문제도 있다. Qwen-Image-2.1은 연구 지향 라이선스로 배포되었고, 커뮤니티 파인튜닝은 기본 모델이 지닌 제한을 그대로 물려받는다. 개인 실험이라면 괜찮다. 상업적 작업이라면 클라이언트 납품이 그것에 의존하기 전에, 그 후가 아니라 전에 정리해야 할 종류의 세부 사항이다.

가져갈 점

실제 작업에서 이미지 모델을 쓴다면, 키워야 할 기술은 프롬프트가 아니다. 분해다. 이미지의 어느 부분은 고정되고 어느 부분은 바뀌어야 하는지 결정하고, 그 부분만 바꾸는 가장 가벼운 도구를 고르는 것. 때로는 낙서로 하는 국소 편집이다. 때로는 마스크, 참조 이미지, 전용 편집기다.

Doodle-in은 연구용 LoRA이고, 다음 달이면 잊힐 수도 있다. 그것이 가리키는 방향은 그렇지 않을 것이다. 내년 이미지 작업을 장악할 도구들은, 당신이 묻지 않은 모든 것을 정확히 원래대로 유지하는 능력으로 평가받을 것이다.

관련 글