IT之家 10월 10일 소식에 따르면, Cloudflare는 어제(10월 9일) 공지문을 발표하여 텍스트, 이미지, 오디오 및 비디오 등을 단일 API 호출로 처리할 수 있는 개방형 권력 결정 모델 Clef-omni를 출시한다고 발표했습니다.

위치 파악 측면에서, 이 모델은 이전의 Clef 시리즈 모델을 기반으로하며, 다중 모드 입력을 지원하는 기능이 확장되었고, 모델의 가중치는 Hugging Face에서 공개되었습니다.
다중 모드 지원 측면에서, 이전의 Clef은 텍스트, 이미지 및 비디오에서 추출된 연속 영상을 지원했으며(비디오를 시간 순서대로 정적 이미지로 추출한 뒤 이 이미지를 순서대로 모델에 입력하였음), Clef-omni는 오디오와 전체 비디오 입력을 추가하여 wav, mp3, mp4 및 webm 형식을 지원한다.
Cloudflare는 개발자가 별도로 음성 변환 및 음성/영상 분할 프로세스를 구축할 필요가 없으며, 한 개의 모델로 다양한 입력 데이터를 처리할 수 있다고 밝혔습니다.
Cloudflare는 Clef-omni가 Qwen3-Omni-30B-A3B-Instruct를 기반으로 구축되었으며 주요 이해 능력을 유지한다고 밝혔습니다. 이 모델은 구조화된 의사결정 작업에 초점을 맞추며 일반 텍스트 출력은 생성하지 않습니다. 회사가 발표한 테스트에서 순수 텍스트 요청의 경우 응답 시간이 약 130밀리초, 이미지의 경우 약 150밀리초였으며, 음성이 포함된 21초짜리 비디오는 약 1.5초 만에 평가가 완료되었습니다.
| 기준 테스트 | 클레프-오미니 | Clef | 클레프-플래시 | Jev |
|---|---|---|---|---|
| BFCL: 정확한 일치율 | 98.2 | 98.47 | 98.76 | 95.75 |
| ToolRet:nDCG@10 | 66.6 | 69.19 | 66.43 | 65.28 |
| API-은행: 정확도 | 92.7 | 91.93 | 93.11 | 88.19 |
| 가정용품: 정확한 일치율 | 69.3 | 82.95 | 97.73 | 52.27 |
| When2Call:정확도 | 63.3 | 72.37 | 65.58 | 80.97 |
| BANKING77:호모 평균 F1 | 94.8 | 94.20 | 90.93 | 79.74 |
| CLINC150+OOS: 매크로 평균 F1 | 97.7 | 97.43 | 66.77 | 89.27 |
| BRIGHT:nDCG@10 | 42.0 | 45.91 | 39.26 | 47.52 |
| 아마존 ESCI: 하이브리드 평균 F1 | 57.8 | 57.48 | 57.39 | 55.21 |
| PhishNChips:정확도 | 73.2 | 79.60 | 75.05 | 62.55 |
Cloudflare는 Clef-flash의 백만 입력 토큰 가격을 0.09달러(IT之家 주: 현재 환율 기준 약 0.6위안)에서 0.038달러(현재 환율 기준 약 0.25위안)로 낮추었으며, 감소율은 약 58%입니다. Clef-flash의 호스팅 버전에서 컨텍스트 윈도우 동기화는 64k에서 24k로 줄어듭니다.
| 모델 | 가격 입력 | 가격을 출력하세요 |
|---|---|---|
| 클레프-플래시 | 백만 토큰당 0.038 달러(현 환율 기준 약 0.25 위안) | 백만 개의 토큰당 0.12달러(현 환율 기준 약 0.8위안) |
| Clef | 백만 토큰당 0.24달러(현 환율 기준 약 1.6위안) | 백만 토큰당 0.72달러(현 환율 기준 약 4.8위안) |
| 클레프-오미니 | 백만 개의 토큰당 0.15달러(현 환율 기준 약 1위안) | 백만 개의 토큰당 0.60달러(현 환율 기준 약 4위안) |
