Qwen 3.8-Max lidera benchmark agentic pero los raw scores mienten en costos reales
Alibaba lanzó Qwen 3.8-Max esta semana posicionándolo como segundo solo a Claude Fable 5 en su tabla de lanzamiento. Pero benchmarks independientes (Artificial Analysis agentic index) muestran patrón inverso: Qwen 3.8-Max en modo preview queda mid-pack en su best setting, último en default. Problema real: raw MMLU/coding scores no predicen costo-beneficio en producción—OpenAI y Anthropic gastan más en tokens de entrada pero entregan mejor ROI. Impacto: devs que cortan costo esperando rendimiento similar se decepcionan. Acción: antes de migrar a Qwen, corre benchmark de agentic en tu carga real (no solo puntuaciones) y compará costo total (input+output tokens) vs Claude/GPT. La burbuja de modelos baratos chinos es real pero fragmentada por case.
