Cloudflare publicó oficialmente un anuncio el 9 de octubre, presentando el nuevo modelo de decisión de pesos abiertos Clef-omni. Este modelo, sobre la base de sus capacidades originales de procesamiento de texto e imágenes, amplía aún más el soporte para formatos de audio y video completo, y puede procesar contenidos multimodales simultáneamente mediante una sola llamada a la API.
Mejora multimodal y análisis de la arquitectura
En cuanto al soporte multimodal, el modelo Clef tradicional procesaba principalmente texto, imágenes y secuencias estáticas extraídas a intervalos de tiempo. El recién lanzado Clef-omni admite de forma nativa formatos de audio y video como wav, mp3, mp4 y webm. Esta mejora elimina los engorrosos pasos que los desarrolladores debían realizar antes, como desplegar procesos adicionales de transcripción de voz y división de audio y video, permitiendo procesar de manera eficiente diversas necesidades de entrada con un solo modelo.
Según los detalles técnicos publicados oficialmente, Clef-omni está construido sobre Qwen3-Omni-30B-A3B-Instruct y conserva sus capacidades centrales de comprensión. El modelo está orientado principalmente a tareas de decisión estructurada y no genera salidas de texto convencionales. En cuanto al rendimiento, el tiempo medio de respuesta para solicitudes de solo texto es de aproximadamente 130 milisegundos, y de unas 150 milisegundos para imágenes; procesar un video de 21 segundos con sonido requiere alrededor de 1.5 segundos para completar la puntuación.
Reducción de precios y comparación de la serie de modelos
Junto con el lanzamiento del nuevo modelo, Cloudflare redujo simultáneamente el precio de uso de Clef-flash: el coste por millón de tokens de entrada pasó de 0.09 dólares a 0.038 dólares, una reducción de aproximadamente el 58%, y la ventana de contexto de su versión alojada se ajustó de 64k a 24k. En conjunto, la actual tarifa escalonada de esta serie de modelos satisface las necesidades de coste y rendimiento de diferentes desarrolladores.