IA on-premise como servicio: tu IA, tus datos, tu edificio
Acabamos de lanzar un servicio nuevo: ia.urbanodx.com, IA on-premise como servicio gestionado. Modelos abiertos, ajustados con los datos de tu empresa, funcionando en un equipo que vive dentro de tu edificio y operado por nosotros, para que tu equipo no tenga que convertirse en un departamento de IA.
Alquilar inteligencia o ser su dueño
Hoy la mayoría de las empresas alquilan su inteligencia. Cada función de IA del negocio pasa por una API de pago por uso: el consumo crece cada mes y el precio por token lo decide otro. Ese arreglo tiene tres problemas de fondo.
La factura no deja de subir. El gasto en APIs es una curva con una sola dirección. Pagas alquiler, cada vez más alto, por una capacidad que nunca será tuya.
Tus datos trabajan fuera de casa. Cada consulta a una API externa envía información de tu negocio a servidores de terceros. Para banca, sanidad, legal o industria, es un riesgo que ninguna cláusula de proveedor elimina del todo.
La regulación aprieta. RGPD y AI Act empujan en la misma dirección: cuanto menos salgan tus datos de tu organización, menos tienes que justificar. Con el modelo en tu edificio, "¿dónde están mis datos?" tiene respuesta de una frase.
Ser dueño le da la vuelta a las tres cosas. El equipo es un activo fijo en tu oficina, el coste marginal de una consulta es la electricidad y nada de lo que tu empresa sabe vuelve a salir por la puerta.
Si esto hoy es una decisión práctica y no un proyecto de investigación es porque los modelos abiertos ajustados con los datos de una empresa ya igualan a las APIs de pago en tareas concretas y bien acotadas. El fine-tuning compensa en el comportamiento, no en los hechos; los hechos salen de la recuperación sobre tus propios documentos, el reparto que explicamos en RAG vs. fine-tuning.
Qué es el servicio exactamente
Tres fases, y la tercera se repite sola:
1. Evaluación y puesta en marcha. Medimos tu caso: qué tareas, qué datos, qué gastas hoy en APIs. Si los números salen, instalamos el equipo en tus oficinas y hacemos el ajuste inicial allí mismo. Tus datos no cruzan la puerta.
2. Servicio gestionado. Nosotros operamos el sistema: monitorización, actualizaciones, soporte y capacidad. Tu equipo solo nota que tiene una IA que conoce el negocio y no factura por token.
3. Reentrenamiento periódico. Tu negocio cambia y el modelo debe cambiar con él. Cada semestre reentrenamos con tus datos nuevos, en remoto y sobre tu propio hardware siempre que es posible.
El hardware viene en cuatro tamaños que comparten el mismo stack: Starter (una pareja de NVIDIA DGX Spark, formato sobremesa, para empresas de hasta unos 100 empleados), Pro (un clúster de cuatro), Business (una torre NVIDIA DGX Station GB300) y Enterprise (un sistema NVIDIA HGX B300 NVL8 con proyecto de sala incluido). Como la capa de software es idéntica, crecer es cambiar de hierro, no rehacer el proyecto.
Esa capa de software es la parte que nos obsesiona: modelos abiertos de las familias Llama, Qwen, Mistral y DeepSeek elegidos por tarea, ajuste fino con tus datos, RAG sobre tu documentación interna citando las fuentes, usuarios, roles y registro de actividad, panel de uso con evaluaciones periódicas de calidad y un servidor de inferencia vLLM con API compatible con OpenAI. Para la mayoría de las herramientas, migrar es cambiar la URL y la clave: la respuesta empieza a llegar de tu sala técnica en vez de salir a la nube.
Sin precios públicos, a propósito
La página del servicio enseña equipos, hardware y software, y ningún precio. Cada propuesta se calcula sobre tu caso real y tu gasto actual en APIs, por escrito, antes de empezar.
La evaluación también puede acabar en "sigue alquilando". Por debajo de cierto gasto en APIs no hay caso de negocio para comprar hardware, y cuando esa es la respuesta honesta, te la damos tal cual y proponemos algo más pequeño: un informe de dimensionamiento, una hoja de ruta o simplemente recortar tu factura actual de APIs. Preferimos perder un proyecto a venderte uno malo.
Haz la cuenta tú mismo
Dimensionar una máquina de IA es aritmética, no magia: bytes por parámetro, un margen de sobrecarga, usuarios simultáneos. Hemos publicado la cuenta completa como una calculadora de VRAM interactiva, junto a una guía en lenguaje claro sobre qué GPU necesita de verdad una empresa.
Para quién es
Para pymes españolas, y dentro de eso, para los sectores donde que los datos salgan del edificio es una pregunta de consejo de administración: banca, sanidad, legal e industria. Si el dilema de alquilar o ser dueño también aplica a tu empresa, escríbenos; la conversación de evaluación empieza igual en cualquier idioma.