Atención dispersa en DeepSeek: menos cálculo no significa leer menos
DeepSeek hizo que un indexador eligiera qué tokens reciben la atención principal y rebajó su API. Separar complejidad, implementación, calidad, caché y tarifa permite comprobar si el ahorro sirve en una carga real.
El 29 de septiembre de 2025, DeepSeek publicó V3.2-Exp, una versión experimental de V3.1-Terminus que incorporaba DeepSeek Sparse Attention. La técnica añadía un indexador ligero para puntuar tokens anteriores y reservaba el cálculo principal de atención para una selección pequeña. Al mismo tiempo, la empresa redujo más de la mitad las tarifas de su API.
Ambas noticias hablan de coste, pero no son la misma afirmación. La arquitectura intenta reducir operaciones; una implementación convierte esa idea en tiempo y memoria; la tarifa es una decisión comercial. La capacidad duradera es medir cada capa con la misma carga y no usar el precio publicado como prueba automática de eficiencia técnica.
La atención principal deja de comparar todo con todo
El informe técnico de DeepSeek describe dos componentes. El “lightning indexer” calcula una puntuación entre cada token de consulta y los tokens precedentes. Después, un selector conserva las 2.048 entradas de clave y valor con mayor puntuación para realizar la atención principal.
En atención densa, el trabajo central crece aproximadamente con el cuadrado de la longitud: duplicar el contexto puede cuadruplicar comparaciones. En DSA, la atención principal crece con la longitud multiplicada por el número fijo de elementos seleccionados. Cuando el contexto es mucho mayor que 2.048, esa parte puede necesitar bastante menos cálculo.
El indexador no hace magia: su complejidad continúa siendo cuadrática porque puntúa candidatos a lo largo del contexto. DeepSeek sostiene que usa pocas cabezas, puede ejecutarse en FP8 y resulta mucho más barato que la atención latente principal. La formulación correcta es “traslada la comparación amplia a un índice ligero y hace dispersa la operación cara”, no “el modelo ya no mira el resto”.
Seleccionar implica aprender qué puede descartarse
El indexador se entrenó primero durante mil pasos mientras los demás parámetros permanecían congelados. Su objetivo era aproximar la distribución de atención del modelo denso. Esa fase procesó 2.100 millones de tokens en secuencias de 128.000. Después, DeepSeek activó la selección dispersa y adaptó todos los parámetros durante 15.000 pasos y 943.700 millones de tokens.
El procedimiento importa porque una regla fija, como atender siempre al principio y al final, fallaría cuando la evidencia aparece en otra posición. El indexador aprende una puntuación dependiente de cada consulta. Aun así, elegir solo una parte crea un riesgo inevitable: la frase necesaria puede quedar fuera de las 2.048 seleccionadas.
La evaluación adecuada es adversarial respecto a la posición. Se colocan nombres, cifras, excepciones e instrucciones en distintas zonas; se añaden distractores parecidos; se cambia su distancia a la pregunta; y se mide recuperación y respuesta. Un promedio general puede ocultar que el ahorro falla precisamente en información rara o contradictoria.
El experimento buscó aislar una sola modificación
DeepSeek partió de un checkpoint de V3.1-Terminus con contexto ampliado a 128.000 tokens. Alineó los datos de entrenamiento largo y mantuvo la misma canalización, algoritmo y datos de posentrenamiento. Según el informe, el único cambio arquitectónico era DSA. Ese diseño permite atribuir diferencias con más confianza que comparar dos modelos entrenados con recetas completamente distintas.
La ficha oficial del modelo publicó resultados de conocimiento, razonamiento, matemáticas, código, búsqueda y uso de herramientas. Algunas puntuaciones subieron, otras bajaron y otras quedaron iguales. DeepSeek resumió el conjunto como ausencia de degradación sustancial frente a V3.1-Terminus, no como superioridad universal.
En GPQA, Humanity’s Last Exam y HMMT, V3.2-Exp obtuvo menos que su referencia. La empresa atribuyó parte de la diferencia a que generaba menos tokens de razonamiento y dijo que checkpoints intermedios con longitudes comparables cerraban la brecha. Es una hipótesis y un análisis del fabricante; una comparación independiente debe controlar también presupuesto de salida.
La gráfica de coste tiene hardware y supuesto
El informe estimó el coste por posición de token usando el servicio real desplegado en clústeres de GPU Nvidia H800 y asignando un alquiler de dos dólares por hora de GPU. Encontró una ventaja creciente en contextos largos para prefill —procesar la entrada— y para decoding —generar la salida—. En entradas cortas usó un modo denso enmascarado para simular DSA con mayor eficiencia.
Esos detalles impiden trasladar la curva sin más. Otra GPU, kernel, precisión, tamaño de lote, paralelismo o nivel de utilización puede cambiar el resultado. Incluso la línea corta utiliza una ruta especial distinta de la dispersa. La cifra reproducible necesita modelo, commit de código, hardware, software, longitud, concurrencia y criterio de coste.
El tiempo de primera respuesta y la velocidad posterior también se separan. El prefill domina cuando entra un documento enorme y la salida es breve; el decoding pesa en razonamiento o generación extensa. Una única cifra de “tokens por segundo” puede esconder cuál de las dos fases mejoró.
Tarifa y coste técnico son ejes distintos
El anuncio oficial de la API dijo que los precios bajaban más del 50 % y que las rutas deepseek-chat y deepseek-reasoner pasaban a V3.2-Exp. La tabla de lanzamiento fijó 0,028 dólares por millón de tokens de entrada recuperados de caché, 0,28 para entrada sin caché y 0,42 para salida.
La diferencia de diez veces entre entrada con acierto y sin acierto no procede solo de DSA. La caché permite reutilizar cómputo sobre un prefijo idéntico. Para obtener esa tarifa, una aplicación debe enviar contenido compatible con la política de caché y conseguir que siga disponible. Un documento nuevo en cada petición no recibe el mismo ahorro.
El proveedor puede fijar precios por debajo, igual o por encima de su coste para atraer demanda, ocupar capacidad o cambiar margen. Por eso la rebaja comercial no demuestra cuánto ahorra DSA; y una mejora de kernel no obliga a trasladar todo el ahorro al cliente. Solo DeepSeek conoce su contabilidad completa.
El coste de una tarea necesita más que precio por token
La factura se calcula separando tokens de entrada con caché, entrada nueva y salida, multiplicados por sus tarifas. Después se añaden repeticiones, herramientas, recuperación documental y solicitudes fallidas. Un agente que hace cinco llamadas baratas puede costar más que una respuesta correcta a la primera.
La métrica útil es coste por resultado aceptado. Se define una tarea, un criterio de calidad y un conjunto estable; se registra coste total de todos los intentos, latencia, errores y revisión humana; y se divide por resultados que pasan. Así una respuesta incompleta no aparece como ahorro por haber generado pocos tokens.
También conviene medir el coste de hospedar los pesos. La licencia MIT autoriza uso y modificación del repositorio y del modelo, pero descargar un checkpoint de cientos de miles de millones de parámetros no lo vuelve barato de ejecutar. Hardware, memoria, almacenamiento, energía, ingeniería y disponibilidad forman el coste total.
Pesos abiertos permiten verificar, no garantizan reproducción
DeepSeek publicó pesos, código de inferencia y kernels para varias implementaciones. Esto permite inspeccionar arquitectura, ejecutar pruebas propias y comparar cambios. La ficha identifica un modelo de 685.000 millones de parámetros y ofrece instrucciones para despliegue distribuido.
Reproducir el checkpoint completo exigiría además datos, proceso de entrenamiento y gran cantidad de cómputo que no se entregan como una receta doméstica. “Pesos abiertos” describe acceso al artefacto; “código abierto”, licencias del software; “entrenamiento reproducible”, la capacidad de reconstruirlo. Son grados diferentes de apertura.
La publicación sí facilita la prueba que más importa para DSA: ejecutar el mismo modelo con cargas representativas y observar memoria, latencia y precisión. Hay que fijar versión, porque cambios posteriores en kernels pueden corregir discrepancias. El experimento debe conservar hashes y resultados brutos.
Una matriz une eficiencia y calidad
Las filas son longitudes de contexto y tipos de tarea; las columnas, prefill, decoding, memoria máxima, coste, recuperación, exactitud y estabilidad. Se añaden variantes con cache hit y miss, datos relevantes en distintas posiciones, varios lotes y concurrencia. V3.1-Terminus sirve como control cuando ambos comparten entorno.
Una ganancia es válida para la celda medida, no para todo uso. DSA puede aportar mucho a documentos largos y poco a un chat breve. Puede reducir la atención central sin bajar el coste de red, recuperación o herramientas. Puede mantener promedios y perder una excepción crítica.
La capacidad transferible es exigir que “más eficiente” complete su frase: eficiente en qué operación, longitud, hardware, implementación, calidad y carga. DeepSeek-V3.2-Exp ofreció mecanismo, pesos y una prueba inicial valiosa. Convertirla en decisión exige medir el resultado aceptado, no dejar que una tarifa o una curva hablen por todo el sistema.
Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.