Ejecuta DeepSeek Localmente: Ollama, Pesos Abiertos, Costo Real

Ejecutando DeepSeek tú mismo con pesos abiertos y Ollama, y las matemáticas del punto de equilibrio contra los precios de la API de DeepSeek fuera de horas punta y caché activada.

DeepSeekOpen WeightsOllamaSelf-HostingAI Perks
Author Avatar
Andrew
AI Perks Team
7,836

Quick Answer

DeepSeek publica pesos abiertos, por lo que puedes ejecutarlo localmente a través de Ollama o servirlo tú mismo. El costo rara vez es la razón. DeepSeek reduce a la mitad los precios de su API en horas no pico y cobra aproximadamente 30 veces menos por la entrada en caché, por lo que el autoalojamiento debe superar los $1.98 por millón de tokens de salida. Los créditos de los proveedores que ejecutan programas para startups se rastrean en getaiperks.com.

¿Puedes ejecutar DeepSeek tú mismo?

Sí. Las versiones de pesos abiertos de DeepSeek son descargables y ejecutables en tu propio hardware, y Ollama es el camino más corto hacia una instancia local funcional. El costo casi nunca es la razón para hacerlo.

Esa segunda oración es la parte que todas las demás guías omiten. La API alojada de DeepSeek ofrece dos descuentos que se acumulan y, juntos, llevan el punto de equilibrio de la auto-alojamiento a un lugar que la mayoría de los equipos no pueden alcanzar con GPUs alquiladas.

Auto-alojar DeepSeek es una decisión de control: residencia de datos, operación sin conexión, fijación de versiones. Trátalo como un plan de ahorro y los números a continuación te decepcionarán.

Los créditos de modelos de los proveedores que realmente los otorgan se rastrean en AI Perks.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Cómo ejecutar DeepSeek con Ollama

Ollama descarga una copia cuantizada de los pesos, los mantiene en el disco local y expone un punto final HTTP compatible con OpenAI en localhost:11434, por lo que el código existente se adapta con un cambio de URL base de una sola línea.

La secuencia de funcionamiento es corta:

  • ollama pull <deepseek-tag> para descargar los pesos
  • ollama run <deepseek-tag> para un prompt interactivo
  • Apunta tu SDK a http://localhost:11434/v1 y pasa cualquier cadena no vacía como clave API

Tres cosas que verificar en la página del modelo antes de planificar un producto en torno a una etiqueta:

Qué variante contiene realmente la etiqueta. Los pesos que caben en una laptop y los pesos detrás del punto final alojado de DeepSeek con frecuencia no son el mismo modelo. Las variantes destiladas y reducidas comparten un nombre de familia y se comportan de manera diferente.

Qué cuantización descargaste. Una compilación de 4 bits reduce la memoria a la mitad en comparación con una compilación de 8 bits y no produce una salida idéntica. Si realizas pruebas de rendimiento localmente y despliegas contra la API, estás comparando dos sistemas diferentes.

Tu techo de contexto real. Localmente, el contexto está limitado por la memoria que tienes, no por la cifra máxima en el anuncio. Un número de contexto largo de una versión alojada no se transfiere a tu máquina.


Lo que el auto-alojamiento tiene que superar

DeepSeek es el único proveedor importante de modelos que cobra por hora del día. Las horas pico son de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, y todo lo que esté fuera de esas ventanas, incluido todo el fin de semana, cuesta exactamente la mitad.

Encima del reloj hay un descuento de caché que es mucho mayor. Las tarifas publicadas actuales, en USD por millón de tokens:

Modelo y tipo de tokenFuera de picoPico
DeepSeek-V4-Pro entrada, caché acertada$0.022$0.044
DeepSeek-V4-Pro entrada, caché no acertada$0.66$1.32
DeepSeek-V4-Pro salida$1.98$3.96
DeepSeek-V4.1-Flash entrada, caché acertada$0.003$0.006
DeepSeek-V4.1-Flash entrada, caché no acertada$0.15$0.30

Un acierto de caché en V4-Pro es aproximadamente 30 veces más barato que un fallo de caché. Combina eso con el reloj y un token de entrada fuera de pico en caché a $0.022 se sitúa 60 veces por debajo de un fallo de caché pico a $1.32, en el mismo modelo. Nada en tu propia infraestructura tiene una palanca 60x. El desglose completo de la ventana se encuentra en nuestra guía de precios fuera de pico de DeepSeek.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Las matemáticas del punto de equilibrio para ejecutar DeepSeek localmente

Derivado de las tarifas publicadas anteriormente: para superar la API fuera de pico de DeepSeek en la salida, tu hardware debe producir un millón de tokens de salida por hora por menos de $1.98, todo incluido.

Esa perspectiva es más útil que cualquier lista de precios de GPU, porque se mantiene independientemente de lo que estés alquilando. Toma el rendimiento que realmente puedes sostener y compáralo con lo que cuesta el mismo volumen en la API:

Rendimiento de salida sostenidoCosto de API fuera de picoCosto de API en pico
100,000 tokens/hora$0.20$0.40
500,000 tokens/hora$0.99$1.98
1,000,000 tokens/hora$1.98$3.96
5,000,000 tokens/hora$9.90$19.80
10,000,000 tokens/hora$19.80$39.60

Cifras derivadas de las tarifas por token publicadas por DeepSeek, no cotizadas de DeepSeek.

Lee detenidamente la fila central. Una máquina que sirve un millón de tokens de salida cada hora, durante todo el día, está desplazando alrededor de $1,425 al mes de gasto en API fuera de pico (derivado: $1.98 x 24 horas x 30 días = $1,425.60). Tu acelerador, el host, el almacenamiento, el ancho de banda y el ingeniero que lo mantiene funcionando deben caber dentro de eso.

La entrada es peor. Si tu carga de trabajo está dominada por un prompt de sistema reutilizado, la API cobra $0.022 por millón de tokens en caché fuera de pico. El auto-alojamiento tiene que superar dos centavos por millón. No lo hará.

La conclusión honesta: el auto-alojamiento de DeepSeek se amortiza con un volumen genuinamente grande, constante y de alta utilización, y casi en ningún otro lugar. Para todo lo que está por debajo de esa línea, la opción más económica es la API más créditos gratuitos de otros proveedores, que es para lo que getaiperks.com existe para mapear.


Cuándo ejecutar DeepSeek tú mismo es la decisión correcta

Auto-alojar DeepSeek gana en control, no en precio. Cinco situaciones lo justifican independientemente de la tabla de punto de equilibrio.

Residencia de datos y cumplimiento normativo. Si los prompts contienen material que no puede salir de tu jurisdicción o de tu red, ningún descuento por token hace que la opción alojada sea viable. Esta es la razón legítima más común.

Operación sin conexión y "air-gapped". Los despliegues de campo, las instalaciones seguras y la conectividad poco fiable requieren inferencia que no dependa de un punto final accesible.

Fijación de versiones. Los pesos locales no cambian bajo tu control. Los modelos alojados sí lo hacen, y DeepSeek lo ha demostrado.

Inmunidad al reloj. La curva de costos auto-alojada es plana. La curva de la API oscila 2x entre la mañana del martes y la noche del sábado, lo que hace que la planificación de capacidad contra ella sea incómoda para cualquier cosa limitada por la latencia en horas hábiles.

Acceso a los pesos mismos. El ajuste fino, la inspección de logits y la decodificación personalizada simplemente no están disponibles a través de una API. Si tu producto los necesita, la decisión nunca fue sobre el costo.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Qué cambió desde nuestra guía anterior de DeepSeek

Nuestra página de precios de DeepSeek de 2026 precede a la generación V4 y a todo el sistema pico y fuera de pico. Cuatro cosas se movieron.

CuándoQué se lanzó
24 de abril de 2026Versión preliminar de V4-Pro y V4-Flash, con contexto de 1M de tokens y modos de pensamiento conmutables reportados en el lanzamiento
31 de julio de 2026DeepSeek-V4-Flash-0731, la versión estable de Flash
13 de agosto de 2026DeepSeek-V4-Pro-0813 alcanza la disponibilidad general
Alrededor del 10 de septiembre de 2026DeepSeek-V4.1-Flash, listado en la documentación como DeepSeek-Flash

Antes del cambio de precios de agosto, la línea Flash era conocida por última vez a $0.14 por millón de tokens de entrada con caché no acertada y $0.28 por millón de salida. Eso es contexto histórico, no una tarifa contra la que puedas facturar hoy.

El cambio disruptivo merece su propia advertencia. DeepSeek-V4.1-Flash retiró silenciosamente los nombres de punto final deepseek-v4-flash y deepseek-v4-flash-vision-exp. Los tutoriales, las respuestas de Stack Overflow y las muestras de código antiguas todavía los referencian, y esas llamadas ahora fallan. Si heredaste una integración de DeepSeek escrita antes de septiembre, busca ambas cadenas antes de depurar cualquier otra cosa.

Esa retirada es también el argumento práctico más sólido para los pesos locales: un modelo en tu disco no puede ser renombrado bajo un despliegue.


DeepSeek no ofrece programas de crédito para startups

La aplicación de chat de DeepSeek es gratuita. La API no lo es, y DeepSeek no opera ningún programa de crédito dedicado para startups en absoluto.

Ser preciso aquí importa, porque es donde la mayoría de los artículos se vuelven descuidados:

  • La aplicación de chat de consumo es gratuita de usar
  • No hay nivel gratuito de API declarado en la página de precios oficial de DeepSeek
  • Las afirmaciones de créditos API gratuitos para nuevas cuentas se informan de manera inconsistente y no están confirmadas en la página oficial, así que trátalas como no verificadas
  • DeepSeek no publica ninguna pista de crédito para fundadores, startups o investigación

Ese último punto es una brecha real. Un fundador puede ejecutar DeepSeek de manera económica, pero no puede ejecutarlo gratis, y no puede compensarlo con una subvención de la manera que puede hacerlo con los proveedores que sí operan programas. AI Perks rastrea $7.7 millones en créditos a través de 194 empresas, cubriendo a los proveedores que otorgan créditos.

Los hosts de terceros son la otra ruta. Baseten lista la entrada DeepSeek V4.1 Flash a $0.30 por millón y tiene un crédito de prueba permanente de $30 para nuevas áreas de trabajo. OpenRouter, Together y Fireworks también sirven modelos DeepSeek. Verifique usted mismo cualquiera de sus tarifas actuales antes de presupuestar contra ellas, porque los precios de enrutamiento se mueven más rápido que los precios de los modelos.


Round Funded
SponsoredRaise money from 10,000+ active vetted investors.
Start Raising

Preguntas frecuentes

¿Puedo ejecutar DeepSeek localmente con Ollama?

Sí. Ollama descarga una copia cuantizada de los pesos al disco local y sirve un punto final compatible con OpenAI en localhost:11434, por lo que el código existente solo necesita un cambio de URL base. Confirma qué variante y cuantización se encuentran detrás de la etiqueta antes de realizar pruebas de rendimiento, porque las compilaciones locales y el modelo alojado de DeepSeek con frecuencia no son los mismos pesos.

¿Es más barato auto-alojar DeepSeek que usar la API?

Por lo general, no. DeepSeek cobra $1.98 por millón de tokens de salida fuera de pico, por lo que una plataforma que sirve un millón de tokens de salida por hora desplaza aproximadamente $1,425 al mes (derivado: $1.98 x 24 x 30). La entrada en caché cuesta $0.022 por millón, lo cual ningún hardware supera. Auto-aloja para residencia y control. Para el costo, usa créditos de AI Perks.

¿Es DeepSeek de código abierto?

DeepSeek se describe mejor como pesos abiertos en lugar de código abierto: los archivos de modelo lanzados son descargables y ejecutables, que es lo que hace posible el despliegue local. Consulta el propio repositorio de modelos de DeepSeek para confirmar qué generación y qué variante se publica realmente, ya que el buque insignia servido por la API y la compilación descargable no siempre son idénticos.

¿Por qué mi llamada a la API deepseek-v4-flash dejó de funcionar?

DeepSeek-V4.1-Flash retiró los nombres de punto final deepseek-v4-flash y deepseek-v4-flash-vision-exp. Cualquier código o tutorial escrito antes de septiembre de 2026 que los referencie fallará. Actualiza al identificador de modelo actual en la documentación de la API de DeepSeek. Este cambio de nombre es un buen argumento para fijar los pesos locales si la estabilidad te importa.

¿DeepSeek ofrece créditos API gratuitos a cuentas nuevas?

No hay un nivel gratuito de API declarado en la página de precios oficial de DeepSeek, y los informes de créditos para cuentas nuevas son inconsistentes y no confirmados. DeepSeek tampoco opera un programa de créditos para startups. Los proveedores que sí lo hacen se rastrean, con las cantidades actuales, en AI Perks.

¿Necesito una GPU para ejecutar DeepSeek localmente?

Las variantes cuantizadas más pequeñas se ejecutarán en CPU, pero el rendimiento cae lo suficiente como para descartar la mayoría de los usos interactivos. Las compilaciones más grandes necesitan memoria de acelerador en proporción a su tamaño y cuantización. Consulta la tarjeta del modelo para la etiqueta específica en lugar de confiar en un requisito genérico, y espera una brecha real entre "cargas" y "utilizable".


DeepSeek te ofrece una elección genuina: una API alojada con precios por reloj y por caché, o la misma familia de pesos en hardware que controlas. Elige el control cuando necesites control. Elige la API cuando necesites rendimiento y cubre la factura con créditos de los proveedores que todavía los regalan.

Suscríbete en getaiperks.com →

Ejecútalo tú mismo o alquílalo. De cualquier manera, deja de pagar el precio completo en getaiperks.com.

This content is for informational purposes only and may contain inaccuracies. Credit programs, amounts, and eligibility requirements change frequently. Always verify details directly with the provider.