Inicio / Noticias / Inteligencia Artificial

DeepSeek R1: La IA China que Sacudió a Silicon Valley con su Precio Imposible

En enero de 2025, un laboratorio de inteligencia artificial chino llamado DeepSeek publicó un modelo de razonamiento open source que obtuvo puntuaciones similares a o1 de OpenAI en múltiples benchmarks. El precio de sus tokens era 95 % más barato que o1. Las acciones de NVIDIA cayeron un 17 % en un día. La comunidad de IA lo llamó el “momento Sputnik”: la señal de que el liderazgo tecnológico de Estados Unidos en inteligencia artificial ya no está garantizado.

¿Qué es DeepSeek y DeepSeek R1?

DeepSeek es un laboratorio de IA fundado en 2023 en Hangzhou, China, parte del fondo de inversión cuantitativa High-Flyer Capital Management. En menos de dos años, el equipo —relativamente pequeño comparado con Google o OpenAI— produjo una serie de modelos que desafiaron los supuestos sobre cuánto cómputo se necesita para crear IA de primer nivel.

DeepSeek R1 es su modelo de razonamiento, entrenado mediante un proceso que el propio DeepSeek describió como basado casi exclusivamente en aprendizaje por refuerzo, sin la necesidad de los masivos conjuntos de datos de fine-tuning supervisado que usan OpenAI o Anthropic. R1 “aprendió a razonar” explorando soluciones por sí mismo, similar a cómo AlphaGo aprendió a jugar al Go.

El impacto en los mercados: ¿por qué cayó NVIDIA?

El colapso bursátil de NVIDIA en respuesta a DeepSeek R1 revela cómo el mercado interpreta la noticia. La tesis que había sostenido la valoración de NVIDIA —que entrenar los mejores modelos de IA requiere cada vez más GPUs, y por lo tanto las ventas de chips de NVIDIA crecerían indefinidamente— fue cuestionada de raíz.

Si DeepSeek logró resultados comparables a o1 usando una fracción de los recursos, el supuesto de que “más chips = mejor IA” pierde fuerza. En la práctica, la caída se recuperó parcialmente en días, pero el mensaje quedó: la eficiencia computacional puede ser tan importante como la escala bruta.

¿Cómo logró DeepSeek resultados tan eficientes?

DeepSeek publicó papers detallados explicando sus técnicas, algo raro en la industria donde la mayoría guarda sus métodos como secretos comerciales. Algunas de las innovaciones clave:

  • Multi-head Latent Attention (MLA): una variación de la arquitectura Transformer que reduce el uso de memoria sin sacrificar rendimiento.
  • DeepSeekMoE: una implementación propia de Mixture of Experts más eficiente que las anteriores.
  • Entrenamiento con refuerzo puro: R1 fue entrenado principalmente con señales de refuerzo (recompensas por respuestas correctas) con mínimo fine-tuning supervisado, reduciendo la dependencia de datos anotados por humanos —un proceso costoso.
  • Destilación: DeepSeek publicó versiones reducidas de R1 destiladas sobre bases como Llama y Qwen, permitiendo que modelos pequeños hereden las capacidades de razonamiento del modelo grande.

¿Qué es la destilación de conocimiento?

La destilación es una técnica donde un modelo grande (el “profesor”) enseña a un modelo pequeño (el “alumno”) a comportarse de forma similar. En lugar de entrenar el modelo pequeño desde cero con datos del mundo real, se entrena con las respuestas del modelo grande como guía.

DeepSeek publicó versiones destiladas de R1 de 1,5B, 7B, 14B, 32B y 70B parámetros. Un modelo DeepSeek R1 de 7B parámetros —que corre en un portátil de gama media— supera a o1-mini de OpenAI en matemáticas. Esta eficiencia democratiza el acceso al razonamiento avanzado.

Las implicaciones geopolíticas

DeepSeek R1 surge en un contexto de tensiones entre Estados Unidos y China en el mercado de chips de IA. Las restricciones de exportación impuestas por el gobierno de Biden limitaron el acceso de China a las GPUs H100 de NVIDIA más avanzadas. DeepSeek logró sus resultados con chips de generaciones anteriores (H800), lo que sugiere que las restricciones no son tan efectivas como esperaban sus diseñadores.

El debate resultante en Washington se centra en si endurecer aún más las restricciones o si, al contrario, estas restricciones están incentivando a China a desarrollar alternativas domésticas más viables.

¿Dónde usar DeepSeek R1?

R1 está disponible gratuitamente en el sitio de DeepSeek (chat.deepseek.com), con un límite generoso en el plan gratuito. También está disponible en múltiples plataformas de terceros como:

  • Amazon Bedrock y Azure AI (para empresas que necesitan garantías de privacidad)
  • Ollama y LM Studio (para ejecutar localmente en tu propia máquina)
  • Hugging Face (para investigadores y desarrolladores)

Para tareas de matemáticas, programación y análisis lógico donde el costo importa, DeepSeek R1 es actualmente el mejor modelo por precio-rendimiento del mercado. La única advertencia: siendo un modelo chino, las empresas con requisitos estrictos de privacidad de datos deben evaluar cuidadosamente dónde lo ejecutan.

webmaster
webmaster
Equipo PuroIA
Especialista en Inteligencia Artificial privada y soberanía digital para empresas latinoamericanas.

¿Le interesa implementar IA privada en su empresa?

Solicite una demostración gratuita de 3 días sin compromiso y vea el poder del ecosistema PuroIA en acción.

Solicitar Demo Gratuita