Cloudflare anunció recientemente la liberación de código abierto de Clef y Clef‑flash, dos modelos pertenecientes a su familia “System One” que están construidos sobre la arquitectura Qwen de Alibaba. El anuncio, publicado en su blog oficial y reflejado en plataformas como Towards AI, marca un paso importante para la comunidad de desarrolladores que buscan soluciones de inferencia ultra rápidas sin depender de licencias propietarias.\n\nLos modelos “System One” hacen referencia al pensamiento rápido e intuitivo descrito por Daniel Kahneman en su libro \"Thinking, Fast and Slow\”. En el contexto de la IA, estos sistemas están diseñados para tomar decisiones en milisegundos, priorizando la velocidad sobre el razonamiento profundo que caracterizaría a un “System Two”. Clef y Clef‑flash están optimizados para cargas de trabajo donde cada milisegundo cuenta, como el enrutamiento de tráfico, la detección de anomalías en tiempo real o la respuesta a solicitudes API en perímetros de red.\n\nDesde el punto de vista técnico, ambos modelos se basan en Qwen, una familia de modelos de lenguaje de código abierto que ha demostrado un buen equilibrio entre capacidad y tamaño. Clef utiliza una variante de Qwen con aproximadamente 1.300 millones de parámetros, mientras que Clef‑flash es una versión aún más ligera, cercana a los 400 millones de parámetros, lo que le permite alcanzar latencias de inferencia por debajo de los 40 ms en hardware de borde estándar. Los autores destacan que, aunque el número 38.8 ms mencionado en algunas pruebas no es el factor decisivo, lo relevante es la consistencia del rendimiento bajo distintas cargas y la facilidad de despliegue en entornos con recursos limitados.\n\nLa liberación de estos modelos tiene implicaciones directas para el edge computing y el IoT. Al disponer de pesos abiertos, los equipos de ingeniería pueden fine‑tunar Clef o Clef‑flash con datos propios de sus redes, adaptando el comportamiento a políticas de seguridad específicas o a patrones de tráfico regionales. Además, al estar bajo una licencia permisiva, se facilita la integración en pipelines de CI/CD existentes y la experimentación con técnicas de cuantización o poda que aún pueden reducir aún más el consumo energético.\n\nEn comparación con otras ofertas abiertas como los modelos de la serie Llama o Mistral, Clef y Clef‑flash se diferencian por su enfoque explícito en la latencia ultra baja y su origen en una empresa que opera a gran escala en la infraestructura de Internet. Mientras que Llama y Mistral suelen estar orientados a tareas de generación de texto o razonamiento complejo, los modelos de Cloudflare están pensados para clasificación, predicción y toma de decisiones rápidas, lo que los posiciona como una herramienta complementaria plutôt que sustitutiva.\n\nPara la audiencia hispanohablante de profesionales de tecnología, esta noticia representa una oportunidad de acceder a tecnología de vanguardia sin barreras de costo ni de licencia, y de contribuir a su mejora mediante la comunidad global. La combinación de un modelo eficiente, una base abierta y el respaldo de la infraestructura de Cloudflare puede catalizar nuevos productos en áreas como la detección de fraudes en tiempo real, la optimización de rutas de contenido y la automatización de respuestas en sistemas de gestión de redes. En un entorno donde la velocidad de respuesta se convierte en una ventaja competitiva, Clef y Clef‑flash se presentan como piezas clave para el próximo salto de la IA en el borde.
Cloudflare libera Clef y Clef‑flash: los modelos ‘System One’ basados en Qwen
Cloudflare ha publicado como código abierto Clef y Clef‑flash, dos modelos de toma de decisiones ‘System One’ entrenados sobre Qwen. Esta liberación promete acelerar la investigación en IA de baja latencia y aplicaciones edge.
IAOnda Redaccion
martes, 6 de octubre de 2026
Comentarios
Cargando comentarios...
Relacionados
Qwen de Alibaba: de 7B a 2.4T, la revolucion de modelos open-weight
Qwen ha evolucionado desde un chatbot exclusivo en 2023 hasta un modelo de 2.4 billones de parametros en 2026. Cada lanzamiento ha redefinido las reglas del juego en IA abierta.
AREX-2: El Agente de IA que se Auto Mejora con Reflexión
AREX-2 revoluciona la auto-mejora de agentes de IA mediante reflexión y ejecución a largo plazo. Este sistema logra resultados excepcionales en múltiples dominios.
Nvidia lanza modelo de 100M de parametros identificar hablantes en tiempo real
El gigante del chip presenta Nemotron 3 Diarization, un modelo gratuito de 100 millones de parametros que distingue hasta ocho voces en vivo. La herramienta promete agilizar la transcripcion automatizada y abrir nuevas posibilidades para asistentes virtuales y atencion al cliente.