Parta de las restricciones y no de las clasificaciones generales. Anote su presupuesto de latencia, el techo de coste por solicitud, el requisito de contexto, si necesita llamadas a herramientas o salida estructurada, y a dónde pueden ir los datos. Esos cinco factores suelen eliminar a la mayoría de los candidatos. Pruebe los dos o tres restantes con cincuenta casos reales de su propio tráfico, compare caso por caso en lugar de por promedio, y elija el más barato que apruebe la prueba.
Primero, diagnostique el fallo. Si el modelo desconoce algo, existe una carencia de conocimiento y la recuperación la subsana. Si el modelo sabe la respuesta, pero la presenta con una estructura, un tono o un formato incorrectos, existe una carencia de comportamiento: se corrige primero mediante prompting y, en segundo lugar, con ajuste fino. Si, pese a ambas medidas, el modelo falla en una habilidad especializada, la opción restante es el ajuste fino. El prompting es lo más barato y reversible; la recuperación es la opción predeterminada adecuada para los datos factuales; y el ajuste fino es la alternativa más cara y menos reversible de las tres.
Los aceleradores de IA consumen mucha más energía por rack que los servidores tradicionales, y esa energía debe ser suministrada, enfriada y pagada continuamente. Entrenar un modelo grande es un pico puntual; servirlo a millones de usuarios es una carga permanente, y la inferencia es lo que domina el uso de energía durante la vida útil de un modelo desplegado.
La generación aumentada por recuperación es un patrón en el que el sistema busca en sus propios documentos pasajes relevantes para una pregunta, introduce esos pasajes en el prompt del modelo y le pide al modelo que responda utilizándolos. Los pesos del modelo nunca cambian; el conocimiento llega como contexto en el momento de la solicitud.
Un agente de IA es un modelo de lenguaje al que se le han dado herramientas que puede invocar, un objetivo que perseguir y permiso para dar varios pasos sin consultar a una persona entre uno y otro. Un chatbot responde y se detiene; un agente sigue actuando hasta que considera cumplido el objetivo o agota su presupuesto.
Los pesos abiertos significan que el archivo del modelo entrenado se puede descargar y ejecutar por uno mismo, bajo la licencia que el publicador elija. El código abierto es un estándar legal más estricto que requiere la libertad de usar, estudiar, modificar y redistribuir sin restricciones sobre el campo de uso. Muchos modelos de uso común son de pesos abiertos pero no de código abierto.
Casi todas las API de IA facturan por millón de tokens, con precios separados para entrada y salida. La salida suele costar varias veces más que la entrada. La entrada cacheada, el procesamiento por lotes y los modelos más pequeños reducen la factura de forma sustancial, y el coste de una conversación crece con el historial porque la mayoría de las API reenvían el hilo completo en cada turno.
Una ventana de contexto es la cantidad máxima de texto, medida en tokens, que un modelo puede considerar en una sola solicitud. Contiene las instrucciones del sistema, la conversación hasta el momento, cualquier documento que pegues y la respuesta que se está generando. Cuando el total supera el límite, algo debe ser descartado o resumido.