Learn.ai.kr
← AI 노트

사진으로 Lyria 음악을 만들 때 문장으로 정할 것

Lyria 3.5에 사진을 넣을 때 공식 자료가 밝힌 범위와 밝히지 않은 부분을 나누고, 사진 속 단서로 창작 브리프를 써서 결과를 통제하는 방법과 바로 쓸 요청문을 정리합니다.

최재현 · 2026.10.03

LinkedIn 공유Threads 공유

자료 기준일: 2026-09-04. Google이 Lyria 3.5를 발표한 날짜입니다. 이미지 입력 설명은 DeepMind 모델 페이지, Gemini 앱 도움말, Gemini API 문서를 2026-10-03에 확인한 내용입니다. API 문서의 "2026-10-01 갱신" 표시는 무엇이 바뀌었는지 알 수 없어 새 출시로 보지 않습니다.

Google DeepMind의 Lyria 모델 페이지에는 "See it, hear it"이라는 구간이 있습니다. 사진을 보여 주고 그 사진으로 만든 음악을 들려주는 예시 모음입니다. Google은 2026년 9월 4일 Lyria 3.5를 Gemini 앱과 Gemini API에 공개했다고 발표했습니다. 발표문에는 사진 입력이 나오지 않으며, 사진 입력은 Gemini 앱 도움말과 API 문서에 안내돼 있습니다. 이 기능이 언제부터 제공됐는지는 확인하지 못했습니다. 이 글은 기능 안내보다 다음 질문을 다룹니다. 사진에는 음악 지시가 하나도 없는데, 사용자는 결과를 어디까지 정할 수 있을까요.

공식 자료가 밝힌 범위

공개된 설명은 짧습니다. DeepMind 페이지는 "이미지를 올리고 Lyria에게 맞춤 트랙으로 바꿔 달라고 요청하라"고만 씁니다. Gemini 앱 도움말은 음악을 만들 때 이미지나 동영상을 맥락으로 올릴 수 있다고 안내합니다. Gemini API 문서(2026-10-03 확인)는 lyria-3.5에 텍스트 프롬프트와 함께 이미지를 최대 10장까지 넣으면 시각 콘텐츠에서 영감을 받은 음악을 작곡한다고 적었습니다.

사진의 어떤 요소가 어떤 음악 요소로 바뀌는지에 대한 규칙은 어느 자료에도 없습니다. API 문서의 예시 프롬프트가 힌트를 줍니다. 사막 노을 사진과 함께 "이 이미지의 분위기와 색에서 영감을 받은 앰비언트 트랙"이라고 씁니다. 사진에서 무엇을 참고할지, 어떤 장르로 만들지는 문장이 정하고 있습니다.

DeepMind Lyria 페이지의 "See it, hear it" 구간 첫 예시는 해안 도로와 바다, 산이 보이는 사진과 그 사진으로 만든 음악입니다. 페이지에는 음악만 있고, 함께 쓴 프롬프트는 공개하지 않았습니다.

이 사진에는 맑은 낮 시간, 바다와 산이 있는 해안, 멀리 이어지는 도로, 파란색과 초록색이 들어 있습니다. 어느 것도 음악 용어가 아닙니다. 그리고 결과 음악만 들어서는 모델이 이 가운데 어떤 단서를 썼는지 알 수 없습니다. 문장 지시, 모델이 사전 학습에서 익힌 장르 관습, 사진이 한꺼번에 작용하기 때문입니다. 사용자가 확실하게 정할 수 있는 것은 문장으로 쓴 부분입니다.

사진 속 단서로 창작 브리프 쓰기

아래 도식은 작성자가 정리한 창작 브리프 작성용 대응표입니다. Google이 공개한 변환 규칙이 아니고, 모델이 실제로 이렇게 해석한다는 뜻도 아닙니다. 사진을 넣기 전에 사진 속 단서를 음악 요소와 짝지어 보면, 결과에 꼭 들어가야 할 요소를 문장으로 빠짐없이 적을 수 있습니다.

가운데 사진에서 색과 밝기는 음색과 분위기, 시간대와 날씨는 템포와 음량, 장소는 악기 편성, 움직임은 리듬의 밀도로 이어지는 방사형 도식

창작 브리프 작성용 대응표(작성자 정리). 사진의 색과 밝기, 시간대, 장소, 움직임을 보고 원하는 음색, 템포, 악기 편성, 리듬 밀도를 문장으로 정할 때 씁니다.

예를 들어 야간 행사 사진으로 음악을 만들 때, 사용자가 조용히 가라앉는 음악을 원한다면 "느린 템포, 피아노와 패드 중심, 보컬 없음"이라고 쓰면 됩니다. 같은 사진에서 활기찬 음악을 원한다면 "120 BPM 전후, 신스와 드럼 중심"이라고 씁니다. Gemini API 문서도 악기, BPM, 조성, 분위기, 구조를 구체적으로 적으라고 권합니다. 지시를 구체적으로 쓰면 원하는 결과를 통제할 수 있고, 다음에 비슷한 결과를 다시 만들 때도 같은 문장을 쓸 수 있습니다.

결과를 해석할 때 알아 둘 제약

Gemini API 문서는 같은 프롬프트로 다시 호출해도 결과가 달라질 수 있다고 적었습니다. 또 API의 음악 생성은 단일 턴 방식이라, 만든 곡을 이어지는 프롬프트로 고쳐 다듬는 기능은 현재 버전의 Lyria 3.5에서 지원하지 않는다고 밝혔습니다. 이 제약은 API 문서에 적힌 내용입니다. Gemini 앱 도움말에는 같은 설명이 없으므로 앱에도 그대로 적용된다고 보지 않습니다.

그래서 결과 한 곡을 근거로 "이 사진은 이런 음악이 된다"고 설명하지 않습니다. 결과에서 확인할 것은 문장으로 요청한 템포, 악기, 보컬 여부, 분위기가 들어갔는지입니다. 요청한 요소가 빠졌다면 그 요소를 더 분명하게 적고 다시 만듭니다. 문장에 적지 않은 부분은 결과마다 달라질 수 있다고 보고, 고정하고 싶은 요소가 생기면 문장에 추가합니다.

바로 쓸 수 있는 요청문

행사 사진 1장으로 2분짜리 홍보 영상 배경음을 만드는 예시입니다. 사진과 함께 아래 문장을 그대로 넣으면 됩니다.

첨부한 사진의 색감과 공간감을 참고해, 2분 길이의 행사 홍보 영상 배경음을 만들어 줘. 장르는 밝은 일렉트로닉 팝, 템포는 118 BPM, 조성은 D장조. 보컬 없이 연주곡으로 만들어 줘. 처음 15초는 신스 패드와 가벼운 퍼커션으로 시작하고, 15초부터 1분 40초까지는 드럼과 베이스를 더해 같은 멜로디를 두 번 키워 가고, 마지막 20초는 패드만 남기고 서서히 줄여 줘. 영상 내레이션이 들어가니 중간 음역을 너무 채우지 말아 줘.

다른 행사에 쓰려면 길이, 장르, 템포, 구간 시각만 바꾸십시오. Gemini API 문서는 lyria-3.5의 길이를 프롬프트로 조정할 수 있다고만 설명하므로, 결과 길이는 생성한 뒤 확인해야 합니다. 사진은 공개해도 되는 것만 올리고, 생성된 음악의 외부 공개 조건은 서비스 약관과 조직의 승인 절차로 따로 확인합니다.

참고한 자료