5 de octubre de 2026Español

Cómo clasificar miles de anuncios de segunda mano al día con Jev (y cuándo sigues necesitando un LLM)

Poner el modelo de decisión Jev de TypeSafe delante de un modelo de OpenAI para clasificar anuncios de segunda mano podría reducir el coste de clasificación entre un 70 y un 90 %. Arquitectura, modelo de costes, umbrales y límites de Jev.

José Antonio García
José Antonio García
CTO · Socio fundador
Read in English
iajevautomatizacionclasificacioncostes-llm

Jev, lanzado por TypeSafe AI el 15 de septiembre de 2026, es un modelo de decisión: lee texto como un modelo de lenguaje (LLM), pero en lugar de redactar una respuesta elige una opción entre las que tú defines y devuelve una probabilidad para cada una. Usado en cascada delante de un modelo de OpenAI —Jev clasifica los anuncios en los que tiene confianza y solo los dudosos pasan a GPT-5.4 mini—, estimamos que el coste de clasificar 10.000 anuncios de segunda mano baja de unos 19,70 $ a unos 4,30 $, una reducción de aproximadamente el 78 %, suponiendo que se escala uno de cada cinco anuncios. En este artículo explicamos la arquitectura, el modelo de costes que hay detrás de esas cifras, cómo fijar los umbrales de confianza y dónde Jev se queda corto.

Qué es Jev (y qué no es)

La mayoría de los flujos de IA actuales usan un LLM para todo, incluidas tareas que en realidad son preguntas tipo test: ¿De qué categoría es esto? ¿Es spam? ¿Es urgente? El LLM responde escribiendo, token a token, aunque la única respuesta válida sea una palabra de una lista cerrada.

Jev funciona de otra forma. TypeSafe lo llama un modelo "System One", en referencia al pensamiento rápido e intuitivo descrito por Daniel Kahneman. Le envías dos cosas:

  • Estado (state): el texto o los datos a evaluar (aquí, título, descripción y precio del anuncio).
  • Preguntas (questions): una o varias preguntas con nombre, cada una con las opciones exactas entre las que puede elegir.

Para cada pregunta devuelve la opción elegida, un nivel de confianza y la probabilidad de cada opción. Varias preguntas sobre el mismo estado se responden en una sola llamada, y el estado se factura una vez por petición, no una vez por pregunta.

Lo que Jev no puede hacer importa igual: no redacta texto, no extrae valores libres, no resume ni razona en voz alta. Solo elige entre las opciones que le das. Ese es precisamente su diseño, y por eso encaja delante de un LLM, no en su lugar.

El problema: clasificar anuncios de segunda mano a escala

Los marketplaces de segunda mano son datos desordenados. Los vendedores escriben títulos como "iphone 12 casi nuevo leer descripción", ponen muebles en la categoría de electrónica y publican el mismo anuncio cinco veces. En un caso de uso típico sobre estos datos —seguimiento de precios, búsqueda de producto para reventa, análisis de mercado— cada anuncio necesita cuatro respuestas:

PreguntaTipoOpciones
Categoría del productoElecciónMóviles · Portátiles · Muebles · Moda · … · Otros
Estado del artículoElecciónNuevo · Como nuevo · Bueno · Desgastado · Para piezas
¿Es un artículo real en venta?Sí/NoExcluye "busco", intercambios, publicidad y spam
¿Es el precio razonable para la categoría?ElecciónDemasiado bajo · Razonable · Demasiado alto

Todas son decisiones acotadas. Pagar a un modelo generativo para que "piense en prosa" sobre cada una, decenas de miles de veces al día, es lo que encarece un flujo basado solo en LLM.

La arquitectura: una cascada de cuatro capas

El LLM no se sustituye. Se convierte en la excepción.

  1. Primero, código determinista. Duplicados, descripciones vacías y precios claramente inválidos se filtran con reglas simples antes de llamar a ningún modelo. Es la capa más barata y debe resolver todo lo que pueda.
  2. Jev para las decisiones acotadas. Las cuatro preguntas van en una única petición por anuncio. Si todas las respuestas superan su umbral de confianza, el anuncio queda clasificado y se guarda. Sin LLM.
  3. GPT-5.4 mini para los casos dudosos. Los anuncios en los que alguna respuesta queda por debajo del umbral pasan al LLM, que recibe también las probabilidades de Jev como contexto.
  4. Revisión humana por muestreo. Cada semana una persona revisa una pequeña muestra aleatoria de las decisiones tomadas solo por Jev, más todos los casos en los que Jev y el LLM no coinciden. Así sabes si los umbrales siguen siendo correctos.

Una versión simplificada de la petición a Jev (los nombres de campos siguen el formato de la API System One en el momento de escribir esto; consulta la documentación de TypeSafe para el esquema actual):

{
  "model": "jev-1.13.0",
  "state": {
    "title": "iphone 12 casi nuevo leer descripción",
    "description": "Batería al 89%, sin golpes, con caja. Solo entrega en mano.",
    "price_eur": 320
  },
  "questions": {
    "category": {
      "type": "choice",
      "instructions": "¿A qué categoría de producto pertenece este anuncio?",
      "criteria": {
        "phones": "Teléfonos móviles y smartphones",
        "laptops": "Ordenadores portátiles",
        "other": "Cualquier cosa no cubierta por las demás categorías"
      }
    },
    "condition": {
      "type": "choice",
      "instructions": "¿En qué estado está el artículo según la descripción del vendedor?",
      "criteria": {
        "new": "Sin usar, precintado o con etiquetas",
        "like_new": "Usado pero sin desgaste visible",
        "good": "Señales normales de uso",
        "worn": "Desgaste evidente o pequeños defectos",
        "for_parts": "No funciona o se vende para piezas"
      }
    }
  }
}

La respuesta devuelve por cada pregunta un choice, un confidence y un mapa de probabilities. El código de enrutamiento son unas pocas líneas: si todas las confianzas superan su umbral, se guarda; si no, se escala.

El modelo de costes

Todos los precios son tarifas públicas en dólares a septiembre de 2026: Jev a 0,042 $ por millón de tokens de entrada, con la salida gratis; GPT-5.4 mini a 0,75 $ por millón de tokens de entrada y 4,50 $ por millón de tokens de salida; GPT-5.4 nano a 0,20 $ y 1,25 $.

Supuestos por anuncio:

  • Jev: unos 650 tokens de entrada (sobrecarga base de la petición, el texto del anuncio y cuatro preguntas). La salida es gratis.
  • LLM: unos 950 tokens de entrada (instrucciones, esquema de salida y el anuncio) y unos 280 tokens de salida (una respuesta estructurada con un breve razonamiento). Los anuncios escalados añaden unos 60 tokens con las probabilidades de Jev.
  • Tasa de escalado: 20 % como caso central, con 10 % y 30 % como análisis de sensibilidad. La tasa real depende de los umbrales y es la cifra que un piloto tiene que medir.

Coste estimado por cada 10.000 anuncios:

ConfiguraciónSolo LLMCascada, 10 % escaladoCascada, 20 % escaladoCascada, 30 % escalado
Jev + GPT-5.4 mini19,73 $2,29 $4,31 $6,33 $
Jev + GPT-5.4 nano5,40 $0,83 $1,38 $1,93 $

Hay dos conclusiones claras. Primero, la parte de Jev es mínima —unos 0,27 $ por cada 10.000 anuncios—, así que el coste de la cascada son casi por completo las llamadas al LLM de los casos escalados. Lo que realmente estás optimizando es la tasa de escalado. Segundo, el ahorro se mantiene incluso frente al modelo más barato de OpenAI: la cascada sigue reduciendo el coste entre un 65 y un 85 % frente a GPT-5.4 nano, porque lo que encarece cada llamada al LLM son los tokens de salida, y Jev no los cobra.

Con 10.000 anuncios al día, la configuración con GPT-5.4 mini pasa de unos 590 $ al mes a unos 130 $ con una tasa de escalado del 20 %. A este volumen las cifras absolutas son modestas; lo que importa es la proporción cuando el volumen crece o cuando el mismo patrón se aplica a un modelo más caro.

Lo que este modelo no cubre: la precisión. El coste se estima fácilmente a partir de las tarifas; si las respuestas de Jev son tan buenas como las del LLM con estos datos concretos, no, y eso es lo segundo que tiene que medir un piloto.

Cómo fijar los umbrales

El umbral es el número más importante de todo el diseño. Si es demasiado bajo, los errores de Jev entran directamente en tus datos; si es demasiado alto, casi todo acaba en el LLM y el ahorro desaparece.

Cómo fijarlos:

  • Fija la versión del modelo (jev-1.13.0, no jev-latest). Unos umbrales ajustados con una versión no tienen por qué valer para la siguiente.
  • Prueba primero en paralelo (shadow testing). Durante una o dos semanas, envía cada anuncio tanto a Jev como al LLM y compara las respuestas antes de que Jev tome ninguna decisión por su cuenta.
  • Usa un umbral por pregunta. La categoría suele ser más fácil que el estado, porque los vendedores describen el estado de forma muy poco consistente, así que no deberían compartir umbral.
  • Vigila la tasa de escalado de forma continua. Es lo que más pesa en el coste, y un salto repentino suele indicar que los datos de entrada han cambiado.

Dónde Jev se queda corto

Jev no es la respuesta para todo:

  • No extrae datos. Marca, modelo y capacidad ("iPhone 12, 128 GB") son valores libres, no opciones. Para eso sigue haciendo falta una expresión regular o un LLM.
  • Los vendedores pueden "convencerle". El texto de los anuncios lo escriben usuarios, y un texto que argumenta a favor de una clasificación concreta puede mover la respuesta; la propia documentación de TypeSafe lo recoge como limitación conocida. Cualquier decisión con consecuencias reales, como marcar un fraude, no debería depender solo de Jev.
  • La opción "otros" hay que cuidarla. Jev solo puede elegir entre las opciones que le das, así que una categoría que falta se convierte sin avisar en la más parecida, aunque sea incorrecta. Una opción "otros" explícita y bien descrita es imprescindible.
  • Límites de uso. En el lanzamiento, TypeSafe publicó un límite de 1.200 peticiones por minuto durante el acceso anticipado: de sobra para decenas de miles de anuncios al día, pero conviene comprobarlo para procesos por lotes más grandes.

Cuándo usar Jev, un LLM o ninguno

Si la tarea es…Usa
Una regla que puedes escribir (precio cero, título vacío)Código
Elegir entre un conjunto cerrado de opciones, a gran volumenJev
Redactar, extraer valores libres o razonar sobre un caso inusualUn LLM
Una decisión con consecuencias reales para una persona o para el negocioUna persona, apoyada por los modelos

El patrón va mucho más allá de los marketplaces. La misma cascada sirve para enrutar tickets de soporte, categorizar facturas y gastos, cualificar leads o moderar contenido: cualquier proceso en el que una empresa paga a un LLM por responder miles de veces al mes lo que en realidad es una pregunta tipo test.

En ScaleWave diseñamos flujos de IA en los que cada paso usa la herramienta más barata que lo resuelve bien: código, un modelo de decisión, un LLM o una persona. Si tu equipo está procesando grandes volúmenes de clasificación repetitiva con un LLM, estaremos encantados de calcular cuánto ahorraría una cascada como esta.

José Antonio García
Sobre el autor
José Antonio García

Ingeniero de software y profesor asociado en IE Business School. Escribe desde la operación, no desde el deck.

¿Listo para transformar tu negocio?

Una conversación de 30 minutos basta para saber si somos el match. Sin costo, sin compromiso, sin plantillas de venta.

Quién va a estar en la llamada — no hay BDRs ni guiones
Gustavo Maryssael
Gustavo Maryssael
CEO · Socio fundador
José Antonio García
José Antonio García
CTO · Socio fundador