Hugging Face수정일

존재하지 않던 모델이라, 직접 만들었습니다

지난주에 나는 그것의 작은 버전이 필요했다 프롬프트 재작성기(prompt rewriter) Qwen-Image 2.1과 함께 제공되는 공식 모델은 약 20 GB의 메모리가 필요한 9B 모델로, 단락 하나를 쓰기 전에 수천 개의 토큰을 생각합니다. Hub에서는 그 동일한 9B 모델의 압축 복사본만 발견했습니다. 그래서 제가 원하는 바를 설명했는데 ML 인턴,

Qwen camera angle LoRA
이미지 출처 · Hugging Face

지난주에 나는 그것의 작은 버전이 필요했다 프롬프트 재작성기(prompt rewriter) Qwen-Image 2.1과 함께 제공되는 공식 모델은 약 20 GB의 메모리가 필요한 9B 모델로, 단락 하나를 쓰기 전에 수천 개의 토큰을 생각합니다. Hub에서는 그 동일한 9B 모델의 압축 복사본만 발견했습니다. 그래서 제가 원하는 바를 설명했는데 ML 인턴, 그리고 다음 날 나는 0.8B 버전 CPU에서 실행되는 모델입니다. 99.7%의 시간 동안 유효한 출력을 반환하며, 교사 모델 토큰의 약 4분의 1을 사용합니다. 9B 모델이 8,797개의 예시 요청에 레이블을 붙이는 작업을 포함한 프로젝트 전체의 컴퓨팅 비용은 USD 16이 들었습니다.

다음 며칠에 걸쳐 나는 같은 방식으로 모델을 다섯 개 더 만들었다. 각 모델은 HuggingChat에서 ML-intern을 켠 상태로 보낸 메시지에서 시작되었고, 각각 Hub에 공개 모델로 등록되었으며 모델 카드에 평가 결과가 담겼다. ML-intern은 작업을 계획하고, 무언가를 쓰기 전에 나에게 예산을 요청하고, 본 작업 전에 작은 테스트를 실행한 뒤, 훈련하고, 평가하고, Hugging Face 하드웨어에서 공개한다.

ML 인턴에게 프롬프트하는 방법

첫 번째 메시지에 제가 노력을 쏟습니다. 저의 첫 번째 프롬프트는, 감귤 아래에 공유된 모델은 약 450단어였습니다. 6번째 프로젝트쯤에는 2,000에 가까워졌는데, 각 프로젝트가 다음 프로젝트에 담고 싶은 것을 가르쳐 주었기 때문입니다. 일곱 가지 프롬프트는 모두 GitHub에 있습니다: yvrjsharma/ml-intern-prompts, 제가 쓴 그대로입니다.

프롬프트는 한 줄 아이디어와 그것을 원하는 이유로 시작합니다. 그다음 정확한 구성 요소들을 명시합니다: 데이터셋, 베이스 모델, 학습 스크립트. 제가 이미 확인해 둔 내용은 말 그대로 "Verified facts, do not re-derive(검증된 사실, 다시 도출하지 말 것)"라는 제목 아래에 넣어, 에이전트가 제가 아는 것을 다시 발견하는 대신 실제 작업에 예산을 쓰도록 합니다. 카메라 앵글 LoRA의 경우 해당 섹션에 어떤 트레이너가 방금 투명 이미지 지원을 추가했는지, 그리고 어떤 공개 GitHub 이슈들 때문에 폴백 트레이너가 위험했는지가 나열되어 있었습니다.

프롬프트에서 두 줄이 매우 중요합니다. 첫 번째 훈련 전에 기준선을 요구합니다. 예를 들어, 감귤 프롬프트 다음과 같이 말합니다: "또한 학습 전 동일한 지표에 대한 베이스 모델의 zero-shot 점수를 보고해서 향상 폭을 볼 수 있게 해달라." 이것이 없으면 학습된 모델만 얻을 뿐 시작 시점보다 나은지 알 수 없다. The 초 체크가 붙어 있는 스모크 테스트입니다. 이미지 LoRA의 경우 저는 50 training steps를 요청한 뒤, 전체 실행 비용을 지불하기 전에 저장된 가중치가 실제로 변경되었는지 확인하는 체크를 걸었습니다.

프롬프트 끝부분에서는 예상 결과물을 명시하고 비용을 제한합니다. 모델 카드에 무엇이 포함되어야 하는지 정의하고 다음과 같은 지시를 포함시킵니다: "총 지출을 USD 12로 제한하고, 이를 초과하기 전에 나에게 문의하세요." ML-intern은 모든 작업을 0달러 예산으로 시작하고 유료 작업을 실행하기 전에 허가를 받아야 하기 때문에, 이 지출 한도는 엄격하게 준수됩니다. 예산을 지정하지 않으면 에이전트가 프로젝트 규모에 따라 몇 가지 경로를 제안하고 어느 것을 선호하는지 묻습니다.

첫 시도에서 이 모든 것이 꼭 필요한 것은 아닙니다. 예를 들어, 저는 검증된 사실 내 섹션 감귤류 간략한 설명이지만 ML Intern은 여전히 그 이상의 모델을 만들어냈습니다 정확도를 세 배로 높였습니다 의 Qwen3.5-2B 모델. ML-Intern으로 단 이틀 만에 만든 6가지를 소개해 드리겠습니다.

1. 여러분의 분야를 아는 모델

범용 비전 모델은 노랗게 변한 감귤 잎을 묘사할 수 있습니다. 하지만 그것이 응애 문제인지 마그네슘 결핍인지 알려주고, 식물을 치료할 생물학적 및 비생물학적 처방을 제시하는 것은 매우 어렵습니다. Claude를 사용하여 저는 Hub의 Project-AgML 조직이 호스팅하는 세 가지 소스에서 병합된 훈련 데이터셋을 만들었습니다. 그 결과물인 citrus-disease-vlm-instruct 은 21가지 서로 다른 해충, 질병, 영양 결핍, 치료 방법에 걸쳐 3,017장의 주석 달린 이미지를 포함하는 데이터셋입니다. ML-intern이 이 예시들을 사용해 Qwen3.5-2B의 파인튜닝을 수행했으며, 사전에 기반 모델을 벤치마크하는 것을 잊지 않았습니다.

335장의 테스트 사진에서 기반 모델은 14.9%의 확률로 올바른 문제를 식별했습니다. A10G 한 대에서 2에포크 학습 후, 파인튜닝된 모델은 52.8%를 기록했습니다. 컴퓨팅 비용은 약 USD 1.90이었습니다.

확인해 보세요: 모델 · 데이터셋 · Citrus Doctor App

2. 여러분의 캐릭터를 그려주는 모델

이미지 모델은 수많은 캐릭터를 알고 있습니다. Hugging Face 브랜드 에셋의 플랫 스타일로 그려진 Huggy는 그 중 하나가 아니었습니다. 저는 ML-Intern에게 LoRA를 요청했습니다. FLUX.2 klein base 4B— 다음에서 가져온 캡션이 달린 드로잉 84개로 학습된 Chunte/huggy_for_training 데이터셋.

에이전트는 100 스텝마다 체크포인트를 저장하고 각 체크포인트마다 동일한 프롬프트 집합을 사용했기 때문에 선택이 쉬웠습니다. 스텝 200에서는 Huggy가 처음으로 완전히 on-model(온-모델). 500 스텝부터 Huggy의 스타일이 Huggy와 전혀 관련 없는 프롬프트에까지 스며들기 시작했습니다! 학습된 LoRA는 4 스텝의 증류된 klein 모델에서도 작동합니다. 컴퓨팅 비용은 약 USD 7.60입니다.

확인해 보세요: 모델 · 데이터셋 · Huggy 제너레이터 앱

3. 새로운 기술을 선보이는 모델

  1. 카메라 앵글 LoRA 이전 Qwen-Image 모델용 커뮤니티 애드온 중 가장 인기 있는 것들에 속합니다. 모델에 물체의 사진을 주고 왼쪽에서 45도 각도로 본 모습을 보여달라고 요청할 수 있습니다. Qwen-Image 2.1 모델 출시 며칠 후에 확인했을 때 아직 아무도 만들지 않아서, ML 인턴에게 이를 만들도록 맡겼습니다.

Qwen camera angle LoRA

ML-intern이 스캔된 1,030개의 가정용 물체를 렌더링했습니다. Google Scanned Objects 각 24개 각도로 총 24,722장의 투명 이미지를 생성했으며, 이 CPU 작업 비용은 몇 센트에 불과했습니다. 이후 훈련용 461개 객체와 테스트용으로 별도로 유지된 40개 객체를 확정했고, 23개 카메라 지시문에 고르게 분포된 훈련 전후 쌍 1,844개를 만들었습니다.

학습은 A100 한 장에서 약 90분 동안 2,000단계를 진행했습니다(약 3.75달러). 전체 프로젝트는 약 반나절과 48개의 작업이 걸렸는데, 여기에는 패키지 누락이나 잘못된 경로로 실패하여 ML-Intern이 다시 제출해야 했던 작업들도 포함됩니다. 총 컴퓨팅 비용은 약 16달러였습니다.

확인해 보세요: 모델 · 데이터셋 · Viewpoint Orbit 앱

  1. Doodle-in LoRA 마젠타 스크리블(낙서)이 있는 사진을 업로드하고 객체 이름을 지정하는 짧은 프롬프트를 추가하는 것도 또 하나의 멋진 아이디어입니다. LoRA는 원래의 조명과 구도를 일관되게 유지하면서 스크리블을 해당 객체로 대체합니다.

이를 위한 데이터셋이 존재하지 않았기 때문에, 프롬프트에 데이터셋을 만드는 방법을 설명했습니다. Open Images의 실제 사진에서 시작하여 LaMa 인페인팅 모델로 하나의 객체를 제거하고, 해당 객체가 있던 자리에 낙서(scribble)를 그립니다. 수정되지 않은 사진이 타깃(target)입니다. ML-intern은 CPU 샌드박스에서 쌍 구축 스크립트를 작성하고 테스트한 후, 이를 GPU 작업으로 실행하면서 모든 원본 사진의 저자와 라이선스를 기록했습니다. 6,042개의 학습 쌍과 160개 쌍으로 이루어진 테스트 세트를 구축했으며, 이 중 40개의 테스트 쌍은 학습에서 완전히 제외된 23개 객체 클래스에서 나온 것입니다.

학습 전에 베이스 모델을 단독으로, 그리고 Viggle turbo LoRA와 함께 측정했고, 편집을 배치로 실행해도 동일한 이미지가 생성되는지 확인했는데, 이를 통해 평가 비용을 절감할 수 있었다. 학습은 A100 한 대에서 1시간 38분 동안 2,000 스텝(~USD 4)으로 진행되었으며, 48개 테스트 페어에 대해 저장된 체크포인트를 비교한 결과 스텝 500을 선택했다.

Paired with the Viggle turbo LoRA 6 스텝에서 LoRA는 정말 좋은 성능을 보였습니다. 67.5% 그려진 위치에서 객체가 감지된 비율은 편집당 4.7초였습니다. 23개의 미학습 클래스에서 온 객체들도 나머지와 마찬가지로 안정적으로 배치되었습니다(65.0% 대 64.2%). 이 프로젝트에는 하루 조금 넘는 시간과 59개의 작업이 걸렸습니다. 총 컴퓨팅 비용은 약 24달러였습니다.

Check out: 모델 · 데이터셋 · Doodle-in 앱

4. 여러분의 기기에 맞는 모델

  1. 이 글 상단의 Pocket Rewriter 가 첫 번째 사례입니다. ML-intern은 Inference Providers를 통해 소규모 instruct 모델로 8,797개의 짧은 이미지 요청을 생성하는 것으로 시작했는데, 제 프롬프트에 설정한 믹스를 따라 사진, 포스터, 로고, 인포그래픽 등을 포함했고, 그중 약 100 분의 1은 따옴표 안의 정확한 텍스트를 요청했으며 많은 요청이 영어 이외의 언어로 되어 있었습니다. 9B 교사 모델이 A100 한 대에서 2시간 37분 만에(약 USD 6.50) 이 모두를 재작성했습니다. 품질 필터링 후 1,840개의 예시가 학습 데이터셋으로 선정되었습니다.
Qwen Image 2.1 Pocket Studio

0.8B 및 2B 학생 모델의 학습은 A10G에서 각각 12분과 18분이 걸렸습니다(둘 합쳐 USD 0.75). 0.8B 모델은 CPU에서 실행할 수 있는 812 MB GGUF 파일로도 제공됩니다. 프로젝트 전체에는 약 11시간과 24개의 작업이 소요되었습니다. 총 컴퓨팅 비용은 약 USD 16입니다.

확인해 보세요: Pocket rewriter 0.8B Student · 2B Student · 데이터셋 · Pocket Studio App · Rewriter Arena에서 teacher-student 비교하기

  1. Agate-Preview-002-4step 이 두 번째입니다. Logolabs의 Agate Preview 002 은 260M 파라미터 텍스트-이미지 모델로, 브라우저에서 돌아갈 만큼 작지만 guidance를 적용해 50단계가 필요하며, 이는 이미지당 100회의 네트워크 패스에 해당합니다. 저는 ML-intern에게 이를 단 4패스로 증류해 달라고 요청했습니다!

두 번의 학습 실행이 필요했습니다. 첫 번째 실행에서는 155,000장의 학습 이미지를 latent로 캐싱하고, guidance를 모델에 베이킹한 뒤, A100에서 단계 수를 16에서 8, 다시 4로 단계적으로 줄였습니다. 4단계 student는 GenEval과 FID에서 동일한 4단계로 실행한 teacher를 능상했고, 이후 ML-intern이 이를 브라우저용 ONNX로 내보냈습니다. 이 실행에는 약 13시간과 USD 22가 소요되었습니다.

두 번째 학습 실행은 ML-Intern에게 4단계 student를 조금 더 개선해 달라고 요청하여 진행했습니다. 그런 다음 16단계로 teacher를 사용해 24,000개의 이미지 쌍을 추가로 만들고, 이를 기준으로 4단계 student를 약 1시간 동안 파인튜닝했습니다. GenEval은 0.509에서 0.536으로 상승했으며, 이는 teacher가 50단계에서 기록한 0.563과 비교된 수치로, 단 4단계(계산량의 4분의 1)만 사용했습니다. ML-intern이 브라우저 버전을 다시 내보냈습니다. 두 번째 실행에는 약 8시간이 걸렸습니다. 두 실행 전체의 총 컴퓨팅 비용은 약 USD 37입니다.

확인해 보세요: Agate 4-step model · 데이터셋 · 브라우저에서 Agate 실행하기 · Agate 4-step LIVE

비용 내역

모델 베이스 모델 컴퓨팅
Citrus Doctor Qwen3.5-2B USD 1.90
Huggy LoRA FLUX.2 klein base 4B USD 7.60
Pocket rewriter (0.8B and 2B) Qwen3.5-0.8B and 2B USD 16.05
Viewpoint Orbit LoRA Qwen-Image 2.1 16달러
Doodle-in LoRA Qwen-Image 2.1 24.30달러
Agate 4-step (두 번 실행) Agate Preview 002 37달러
합계 약 103달러

위 금액은 각 세션에 대해 보고된 GPU 및 CPU 작업 비용입니다.

직접 만들어 보기

ML-intern이 HuggingChat에 들어왔습니다. ML-intern 모드를 켜고 프롬프트를 붙여넣으세요. 시작점이 필요하다면, 제 예시 프롬프트 를 자유롭게 복사해도 됩니다. 존재했으면 하는 모델과 보유 중이거나 설명할 수 있는 데이터셋에서 시작하세요. 작은 예산을 정하고, 베이스라인과 스모크 테스트를 요청한 뒤, 한도를 올리기 전에 돌아온 결과를 읽어보세요.

이를 활용해 무언가를 만들었다면 X에 공유하고 @Gradio 와 @HuggingFace를 태그해 주세요. 여러분이 만들고 다른 누구도 생각하지 못했던 모델을 보고 싶습니다.

원문 출처

Hugging Face

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요