IAAnálisis

Modelos de decisión de IA: Strands Decider de AWS vs. Clef

Los modelos de decisión de IA eligen de una lista fija y dan puntajes de confianza, no texto. Así se comparan Strands Decider de AWS y Clef y a quién le sirven.

Basado en fuentes. Escrito a partir de los documentos, reportes y reseñas enlazados en el texto. The Ruling Desk no probó nada de esto en persona. Cómo trabajamos

Una tarjeta gráfica Gigabyte GeForce RTX 3090 con tres ventiladores, de pie sobre un escritorio de madera
Foto: PantheraLeo1359531 / Wikimedia Commons, CC BY 4.0

Los modelos de decisión de IA son un nuevo tipo de modelo que nunca escribe una oración: le das un contexto y una lista corta de respuestas permitidas, y te devuelve la respuesta que eligió más un puntaje de confianza para cada opción. El 1 de octubre de 2026, Amazon Web Services lanzó uno abierto llamado Strands Decider 2B y Cloudflare lanzó dos, Clef y Clef-flash, días después de que OpenAI presentara una vista previa del suyo. Aquí te explicamos qué hacen estos modelos en palabras simples, cómo se comparan los dos lanzamientos abiertos en tamaño, licencia, dónde corren y lo que cada empresa dice de su velocidad, y qué desarrolladores de verdad usarían uno.

Puntos clave

  • Un modelo de decisión elige, no escribe. Responde preguntas como "¿qué equipo debe atender este ticket?" calificando un conjunto fijo de opciones, así que tu código recibe una etiqueta y una probabilidad en lugar de un párrafo que hay que interpretar.
  • Strands Decider 2B cabe en una laptop. Es un modelo de 2,000 millones de parámetros basado en Qwen3.5-2B, de Alibaba, publicado con licencia Apache 2.0, y AWS dice que responde en una mediana de 115 milisegundos en una tarjeta gráfica RTX 3090.
  • Clef, de Cloudflare, es más grande y se usa en la nube. Clef (27B) y Clef-flash (9B) también son Apache 2.0, corren en Workers AI de Cloudflare, y Cloudflare afirma que Clef-flash tiene una latencia mediana de 38.8 ms. Son cifras de las propias empresas, medidas en hardware distinto, así que no se comparan directamente.
  • Ambos copian la idea de una startup. El modelo de pago Jev, de TypeSafe AI, inauguró la categoría en septiembre, y Clef está hecho para aceptar las mismas llamadas a la API.
  • La mayoría de la gente nunca usará uno. Son piezas para desarrolladores que operan agentes de IA y automatización de alto volumen, no chatbots.

Qué hacen en realidad los modelos de decisión de IA

Un modelo de chatbot normal genera texto palabra por palabra. Eso está muy bien para un ensayo y es un desperdicio para un sí o un no. Si un agente solo necesita saber si un correo es una solicitud de reembolso, un modelo de lenguaje completo gasta tiempo y tokens escribiendo una respuesta que luego tu código tiene que interpretar, y puede redactarla distinto cada vez.

Un modelo de decisión se salta la escritura. El anuncio de Clef de Cloudflare lo describe como un modelo que "hace clasificaciones para ayudar a los agentes a decidir cómo actuar", y que devuelve respuestas tipadas con probabilidades que tu código puede usar para enrutar un ticket, escalarlo o pasárselo a una persona. El modelo lee toda la entrada de una sola pasada y luego califica las opciones válidas en paralelo, en lugar de producir tokens uno por uno.

La promesa es velocidad, consistencia y un número de confianza útil. Si el modelo está 97% seguro, tu flujo de trabajo sigue; si está 55% seguro, puedes mandar el caso a un modelo más grande o a una persona.

De dónde salió la idea

La plantilla es Jev, de TypeSafe AI. Tim Fernholz, de TechCrunch, informa que Jev se lanzó en septiembre de 2026 y que los productos de decisión que vinieron después son, en la práctica, clones suyos. El sitio de TypeSafe llama a Jev su primer "System One Model" público, hecho para tomar decisiones dentro del software, y fija su precio en US$42 por cada 1,000 millones de tokens de entrada. Jev es una API de pago alojada por la empresa; los modelos de AWS y Cloudflare son pesos abiertos que puedes descargar.

Cómo funciona Strands Decider 2B

Strands Decider lo publica Strands Labs, y TechCrunch atribuye el trabajo a Marc Brooker, Distinguished Engineer de Amazon. Según el repositorio de Strands Decider en GitHub, el equipo tomó Qwen3.5-2B-Base (1,900 millones de parámetros), desechó la parte que genera texto y la reemplazó por una pequeña "cabeza de punteros" (pointer head) de alrededor de un millón de parámetros que califica cada opción. Un ajuste fino ligero (un adaptador LoRA de rango 16) le enseña al resto del modelo a alimentar esa cabeza.

Maneja tres tipos de pregunta: sí o no, una opción entre varias y un puntaje en una escala ordenada. El repositorio da estas cifras para la versión de referencia actual, la v19:

  • Precisión: 0.723 (167 de 231) en el conjunto público de JevBench, la prueba que lleva el nombre de Jev.
  • Latencia: una mediana de 115 ms y un percentil 95 de 299 ms en una Nvidia RTX 3090; una mediana en caliente de 153 ms en un Apple M3 Pro con entradas de menos de 300 tokens.
  • Calibración: las respuestas dadas con una confianza de 0.9 o más aciertan alrededor del 95% de las veces, según AWS.

Se instala con pip install strands-decider y puedes hacerle preguntas desde la línea de comandos o correrlo como un servidor HTTP local, en Nvidia, Apple silicon o un CPU común. Los pesos están en Hugging Face con licencia Apache 2.0, que permite el uso comercial. SiliconANGLE informa que AWS eligió a propósito el tamaño de 2,000 millones de parámetros, porque dice que logra el equilibrio correcto, y lo propone para enrutar entre modelos, elegir herramientas, aplicar barreras de seguridad y revisar políticas. TechCrunch agrega que llegó a ocupar brevemente el primer lugar de JevBench entre los modelos de su tamaño.

Cómo funciona Clef de Cloudflare

Los dos modelos de Cloudflare son más grandes. Según la publicación de la empresa, firmada por Michelle Chen, Clef está construido sobre Qwen3.8-27B y Clef-flash sobre Qwen3.5-9B, cada uno con una cabeza de enrutamiento entrenada junto con adaptadores de bajo rango de rango 256. Ambos son de código abierto con licencia Apache 2.0 y están alojados en Workers AI, el servicio de Cloudflare para correr modelos en sus propias GPU.

La ficha del modelo Clef-flash dice que acepta texto, JSON, imágenes o video, y que su API es "totalmente compatible con Jev". Eso importa más de lo que parece: un equipo que ya usa Jev puede, en principio, apuntar el mismo código a Cloudflare.

Las cifras de Cloudflare, medidas en su servicio en la nube:

  • Latencia mediana: 209.3 ms para Clef, 38.8 ms para Clef-flash y 524.1 ms para Jev.
  • Pruebas: en la prueba de intenciones BANKING77, un macro-F1 de 94.20 para Clef, 90.93 para Clef-flash y 79.74 para Jev. Cloudflare también dice que Clef superó a Jev en 3 de 4 áreas del propio conjunto de evaluación de TypeSafe.

Son cifras de Cloudflare, no pruebas independientes. La publicación no da un precio de Clef en Workers AI.

Strands Decider vs. Clef, lado a lado

Strands Decider 2BClef-flashClef
Hecho porAWS (Strands Labs)CloudflareCloudflare
Tamaño1.9B (Qwen3.5-2B-Base)9B (Qwen3.5-9B)27B (Qwen3.8-27B)
LicenciaApache 2.0Apache 2.0Apache 2.0
Dónde correTu laptop o servidorWorkers AI, o en tus servidoresWorkers AI, o en tus servidores
EntradasTextoTexto, JSON, imágenes, videoSin detallar
Latencia mediana según la empresa115 ms en una RTX 309038.8 ms en Workers AI209.3 ms en Workers AI
PrecioDescarga gratisNo publicadoNo publicado

La fila de latencia es la trampa. AWS midió Strands Decider en una sola tarjeta gráfica de consumo; Cloudflare midió Clef en las GPU de sus propios centros de datos. Ninguna de las dos empresas probó el modelo de la otra, y JevBench y el conjunto de pruebas de Cloudflare no son la misma prueba, así que con estas cifras no puedes decir que uno es más rápido o más preciso.

Más modelos de decisión de IA de OpenAI y Perplexity

AWS y Cloudflare no estuvieron solos. En el DevDay del 29 de septiembre, OpenAI anunció una Decisions API basada en GPT-6 Luna, que su cuenta para desarrolladores publicó como "disponible en vista previa limitada", sin precio publicado. Nuestro resumen del DevDay 2026 la cubre junto con el resto del evento, y nuestra explicación de GPT-6 Luna cubre el modelo que tiene debajo.

Perplexity siguió el 1 de octubre con pplx-decider-v1-27b, otro ajuste fino de Qwen3.8-27B cuyos pesos están en Hugging Face con licencia Apache 2.0. Perplexity reporta un 85.71% general contra 84.51% de Jev en su propio panel de pruebas, y su cuenta para desarrolladores fija el precio en US$0.04 por millón de tokens de entrada. Así, a pocas semanas del lanzamiento de Jev, cuatro grandes empresas ya tenían su versión, y tres de las cuatro publicaron pesos abiertos.

Qué significa para ti

Si desarrollas software que llama a un modelo de IA miles de veces al día para clasificar, enrutar o aprobar cosas, vale la pena probar los modelos de decisión. Los trabajos para los que sirven:

  • Enrutamiento: mandar un ticket de soporte a facturación, soporte técnico o ventas.
  • Pasos de un agente: elegir la siguiente herramienta, o decidir si una tarea ya terminó.
  • Barreras de seguridad: marcar un mensaje que viola una política antes de que salga.
  • Triaje con respaldo: dejar que el modelo pequeño resuelva los casos en los que está seguro y escalar el resto.

Cuál conviene depende de dónde vive ya tu código:

  • Strands Decider 2B es para equipos que quieren mantener los datos en sus propias máquinas, trabajar sin conexión o evitar un cobro por llamada. Un modelo de 2B corre en una laptop, y Apache 2.0 te deja incluirlo dentro de un producto.
  • Clef o Clef-flash es para equipos que ya usan Cloudflare Workers, o para quien use Jev y quiera una alternativa abierta con la misma API. Clef-flash además acepta imágenes y video.
  • Ninguno sirve para respuestas abiertas. Si necesitas un resumen, una explicación o texto extraído libremente, sigues necesitando un modelo de lenguaje normal.

Si solo usas ChatGPT o Claude, nada cambia para ti de forma directa. Quizá lo notes de forma indirecta, si las apps que usas se vuelven más rápidas y baratas porque un modelo diminuto toma las decisiones rutinarias tras bambalinas. Para más sobre los modelos detrás de esas apps, visita nuestra sección de IA.

En resumen

Los modelos de decisión de IA son una idea acotada y útil: dejar que un modelo pequeño elija de una lista y diga qué tan seguro está, y guardar el modelo grande para los casos difíciles. Strands Decider 2B es el que conviene probar si quieres algo gratis que corra en tu propio hardware; Clef es el indicado si estás en Cloudflare o ya usas la API de Jev. Todas las cifras de velocidad y precisión hasta ahora vienen de las propias empresas, medidas en su propio hardware y con sus propias pruebas, así que lo siguiente que hay que vigilar son las pruebas independientes lado a lado, además de los precios de Clef en Workers AI y de la Decisions API de OpenAI.

Preguntas frecuentes

¿Qué es un modelo de decisión en IA?

Es un modelo que elige una respuesta de una lista fija que tú le das y devuelve un puntaje de confianza para cada opción, en lugar de escribir texto. Cloudflare lo describe como un modelo que hace clasificaciones para ayudar a los agentes a decidir cómo actuar. Los desarrolladores los usan para enrutar, clasificar y elegir el siguiente paso en flujos de trabajo automatizados.

¿Strands Decider 2B es gratis?

Sí. El código está en GitHub y los pesos en Hugging Face con licencia Apache 2.0, que permite el uso comercial. Solo pagas el hardware en el que lo corres.

¿Puedo correr Clef en mi propia computadora?

Los pesos de los dos modelos Clef están publicados con licencia Apache 2.0, así que puedes alojarlos tú mismo, pero tienen 9,000 y 27,000 millones de parámetros y necesitan mucha más memoria de GPU que los 2,000 millones de Strands Decider. La oferta principal de Cloudflare es correrlos en Workers AI.

¿En qué se diferencia un modelo de decisión de la salida estructurada de un LLM normal?

Un modelo normal con salida estructurada sigue generando su respuesta token por token y luego le da formato. Un modelo de decisión, tal como AWS y Cloudflare describen los suyos, nunca genera texto: califica directamente las opciones permitidas en una sola pasada, y de ahí vienen las promesas de velocidad de las empresas.

Archivado en IA

Boletín

Artículos nuevos, en tu correo.

Gratis. Cancela con un clic. Tu correo lo guarda beehiiv, nuestro servicio de boletines, y solo se usa para este boletín.