DeepSeek-V4 Latent Reasoning - Modelo autónomo con razonamiento en espacio latente
Show HN: DeepSeek-V4 Latent Reasoning – moving "thinking" into latent space
DeepSeek-V4 Latent Reasoning es un modelo de lenguaje autocontenido que integra razonamiento en espacio latente, cuantizado a NVFP4 y servido con un runtime de vLLM optimizado. A diferencia de los adaptadores tradicionales, este modelo incluye todos los pesos necesarios en un solo repositorio, con una cabeza de razonamiento entrenada (35.7M de parámetros) que comprime el pensamiento en un espacio latente de 1024 dimensiones, logrando un factor de compresión de 6. Alcanza un 0.880 en BBH (BIG-Bench Hard) con razonamiento activado. El runtime, dividido en dos repositorios, permite servir el modelo con una sola línea de comandos, con soporte para speculative decoding y control fino mediante variables de entorno y cabeceras HTTP. Ideal para aplicaciones que requieren razonamiento multi-paso eficiente, como seguimiento de objetos, lógica formal y comprensión temporal.
La edición anterior era un adaptador que había que ensamblar a mano; ahora es un modelo completo, autocontenido, con todos los pesos necesarios para servirlo en un solo repositorio.