Integración de LLM e IA generativa

Añade funciones con modelos de lenguaje al software que ya utilizas.

La mayoría de las empresas que acuden a nosotros no necesitan un producto de IA nuevo. Necesitan que el software que ya utilizan —el CRM, el portal, el back office, las herramientas internas— haga cosas que hace dos años no podía hacer: responder preguntas con sus propios datos, redactar los documentos que antes escribía una persona, clasificar la cola antes de que nadie la abra.

Eso es un problema de integración antes que un problema de IA. El modelo es la parte fácil. El trabajo está en la capa de búsqueda, los permisos, las pruebas y en qué hace el sistema cuando el proveedor va lento, te limita las peticiones o se cae a mitad de una petición. Integramos sistemas desde 2006 y esto lo tratamos igual: ingeniería de producción en la que además interviene un modelo.

Hablemos de tu proyecto

Qué entrega el proyecto

  • Una integración funcionando en tu propio código y tus repositorios
  • Búsqueda sobre tu propio contenido, respetando tus reglas de acceso actuales
  • Un conjunto de pruebas que mide la calidad de las respuestas, para ver si un cambio mejora o empeora
  • Ajustes de prompts, modelos y costes que puedes cambiar sin un despliegue
  • Salvaguardas: validación de entradas, límites de salida, timeouts, reintentos y un plan alternativo definido cuando el proveedor va lento o se cae
  • Coste y velocidad visibles por funcionalidad, en la monitorización que ya utilizas

Responder preguntas con tus propios datos

Un modelo que nunca ha visto tus datos responderá con seguridad y se equivocará. La solución es consultar primero: indexamos tus documentos, tickets, registros o catálogo, localizamos los fragmentos que afectan a la pregunta y entregamos al modelo solo esos, con enlaces a la fuente original.

Casi todo el trabajo está en los detalles. Dividir los documentos para no partir una tabla por la mitad. Combinar la búsqueda por palabras clave con la búsqueda por significado, porque las referencias exactas y los nombres propios siguen importando. Ordenar los resultados para que el mejor aparezca primero. Y aplicar tus permisos durante la búsqueda, de modo que nadie vea un fragmento de un documento que no podría abrir por su cuenta.

Cuando es posible construimos sobre infraestructura que ya pagas —tu base de datos Postgres o tu clúster de búsqueda actual— en lugar de añadir otro proveedor a tu stack.

Agentes que actúan, dentro de los límites que fijas

Un agente es un modelo capaz de invocar tus funciones. Es potente y también la vía más rápida para construir algo impredecible. Por eso mantenemos los agentes acotados: un conjunto definido de herramientas, permisos explícitos en cada una y un paso de aprobación humana allí donde una acción sea costosa o difícil de deshacer.

Los agentes útiles que entregamos son poco espectaculares de describir y muy valiosos en operación: clasificar una cola de entrada y derivarla con un motivo, reconciliar dos sistemas que discrepan, redactar un presupuesto a partir de una especificación o ejecutar un proceso de back office que antes exigía copiar valores entre cuatro pantallas.

Dos reglas hacen casi todo el trabajo de seguridad. Las credenciales nunca entran en un prompt: el modelo indica el flujo y sus parámetros, y el servidor añade la dirección y el token de acceso. Y todo el código que escribe el modelo se ejecuta en un entorno aislado con los permisos justos.

Cada llamada a una herramienta queda registrada con sus entradas y su resultado, así que cuando algo falla puedes ver exactamente qué hizo el modelo.

Trabajar con documentos largos

Un contrato de 300 páginas no cabe en un prompt. Es lento, caro y deja de funcionar en cuanto entran varios documentos en juego. En su lugar guardamos los documentos, los procesamos en segundo plano con OCR y extracción de tablas, y dejamos que el modelo lea solo las partes que necesita.

Así el tamaño del documento deja de determinar el coste y la velocidad. Una revisión de contrato mira las cláusulas que importan, y la respuesta cita una página y un párrafo reales para que alguien pueda comprobarlo.

Elección de modelo, coste y flexibilidad

Trabajamos con los principales proveedores —Anthropic, OpenAI y modelos de pesos abiertos que puedes alojar tú mismo cuando la residencia de datos o el coste lo exigen. Los proveedores se diferencian de forma real, así que no fingimos que sean intercambiables. Lo que sí garantizamos es que cambiar de uno suponga modificar la configuración y repetir el conjunto de pruebas, no reescribir.

El coste es un parámetro de diseño desde la primera semana, no algo que descubres en la primera factura.

Para equipos en la UE diseñamos pensando en dónde acaban los datos: endpoints regionales, configuraciones sin retención o modelos totalmente autoalojados cuando nada puede salir de tu infraestructura.

Cómo trabajamos

El primer encargo suele durar de dos a cuatro semanas: descubrimiento, una revisión seria de los datos sobre los que se va a buscar y una porción funcional del caso de uso de mayor valor ejecutándose contra tus sistemas reales. Esa porción es la estimación. Dice mucho mejor que un documento lo que costará la construcción completa.

A partir de ahí, nuestro CEO y nuestros ingenieros senior definen el alcance y formamos el equipo a partir de una red de más de 100 ingenieros con los que llevamos una década o más trabajando. Demos semanales, código en tus repositorios, traspaso a producción y soporte posterior al lanzamiento. En veinte años no hemos abandonado ningún proyecto.

Preguntas frecuentes

¿Cuánto tarda una integración de LLM?

Un primer caso de uso listo para producción suele llevar de seis a doce semanas, con una porción funcional contra tus datos reales dentro del primer mes. La variable rara vez es el modelo. Es el estado de los datos sobre los que se busca y el número de sistemas que la funcionalidad debe tocar.

¿Podéis trabajar con nuestro código y nuestra nube actuales?

Sí. Construimos dentro de tus repositorios, tu CI y tu cuenta de nube. Nuestros ingenieros trabajan con backends en .NET Core, Node, Python, Java y PHP, front ends en React, Vue o Angular, sobre AWS, Azure, Google Cloud e infraestructura on-premise, y el entregable es código que tu propio equipo puede mantener cuando nos vayamos.

¿Cómo evitáis que nuestros datos entrenen al modelo?

Mediante planes empresariales de API sin retención de datos, endpoints regionales o europeos y modelos de pesos abiertos autoalojados cuando el requisito es que nada salga de tu infraestructura. La política de tratamiento de datos se acuerda durante el descubrimiento, antes de escribir ninguna integración.

¿Cuánto cuesta mantenerlo en funcionamiento?

Depende del volumen y del diseño del sistema, y por eso tratamos el coste como una restricción de diseño desde la primera semana. El enrutado de modelos, el cacheo y el recorte de contexto suelen reducir el gasto en inferencia en un orden de magnitud, y hacemos visible el gasto por funcionalidad para que puedas verlo.

Hable con Nuestros Expertos sobre Su Proyecto de IA o Software

Complete el formulario y le responderemos en un día hábil.

Evgueny Lemasov — CEO de ITFriends.AI

Evgueny Lemasov

CEO, ITFriends.AI