Cloudflare는 최근 새로운 개방형 가중치 결정 모델인 Clef-omni를 공식적으로 출시했습니다. 이 모델은 기존 Clef 시리즈를 기반으로 큰 업그레이드가 이루어졌으며, 텍스트와 이미지에 대한 원천 지원 외에도 처음으로 오디오와 전체 비디오 입력에 대한 직접적인 처리 기능이 추가되었습니다. 현재 이 모델의 가중치는 Hugging Face 플랫폼에서 전면적으로 오픈소스로 공개되어 있습니다.
기술 구현 및 기능 특성 측면에서 Clef-omni는 전통적인 처리 경로를 완전히 바꾸었습니다. 이전 버전의 Clef은 비디오 입력 시 시간축으로 분할된 연속적인 정적 이미지로 처리를 해야 했지만, 새로운 Clef-omni는 wav, mp3, mp4 및 webm과 같은 주요 음성 및 비디오 형식을 직접 지원합니다. 이로 인해 개발자는 복잡한 음성 전사 및 음성·비디오 분할 파이프라인을 별도로 구축할 필요가 없으며, 단 한 번의 API 호출만으로 텍스트, 이미지, 오디오 및 비디오를 통합적으로 처리할 수 있습니다.
성능 및 기준 테스트 결과에 따르면, 이 모델은 Qwen3-Omni-30B-A3B-Instruct 기반 아키텍처를 기반으로 구축되었으며,其核心 이해 능력이 완전히 유지되어 있습니다. 구조화된 의사결정 작업에 집중하는 전용 모델로서, 일반적인 긴 텍스트를 생성하지 않습니다. 공식적으로 발표된 실험 데이터에 따르면, 순수 텍스트 요청의 평균 응답 시간은 약 130밀리초이며, 이미지 요청은 약 150밀리초입니다; 또한 음성이 포함된 21초 길이의 비디오를 처리하는 데도 약 1.5초만이 필요하여 효율적으로 평가를 완료할 수 있습니다.
새로운 모델의 출시와 함께 Cloudflare는 자사의 다른 제품 라인에 대한 가격 조정 및 최적화도 진행했습니다. 그 중 Clef-flash의 입력 가격은 약 58%나 크게 낮아졌으며, 기존에 백만 입력 토큰당 0.09달러였던 수치가 0.038달러로 줄었습니다. 호스팅 버전의 컨텍스트 윈도우는 64k에서 24k으로 조정되었습니다. 전반적으로 Clef-omni의 오픈소스화와 다중 모드 처리 능력의 확보를 통해, 전 세계 개발자들이 복잡한 지능형 워크플로우와 자동화된 의사결정 시스템을 구축하는 데 더욱 효율적이고 비용 효율적인 기반이 마련되고 있습니다.