Versión 2.4.9#
Ya está disponible una nueva versión de Sherpa AI Server: Versión 2.4.9.
1. Confiabilidad de la pantalla Chat#
En la pantalla Chat, el indicador de actividad ya no desaparece mientras el run está activo. Si ocurre un error, la cinta muestra el texto del error y el botón Reintentar.
Ahora el título de la conversación se construye a partir del primer mensaje del usuario en lugar de un fragmento del documento; se descartan los temas inventados por el modelo de lenguaje. La generación del título ya no falla con el error 500 en una respuesta larga de un modelo de razonamiento: el bloque interno de razonamiento sin cerrar se elimina y el título se recorta a 256 caracteres.
Esto ayuda a comprender el estado de la conversación, recuperarse más rápido después de un fallo y ver nombres de chat significativos.
2. Fuentes de respuesta del Asistente#
En la pantalla Chat, los fragmentos técnicos de RAG se ocultan dentro de un bloque colapsado de fuentes de respuesta. El bloque se puede expandir; en el estado expandido ocupa todo el ancho del área de respuesta y muestra las fuentes en tres columnas.
Esto facilita la lectura de la respuesta del Asistente y mantiene disponibles las fuentes técnicas cuando se necesitan.
3. Configuración del chat y modelo predeterminado#
Si una cuenta no tiene modelos propios, en la configuración del chat se muestra el modelo predeterminado del entorno de Sherpa AI Server.
Esto ayuda a empezar a trabajar en el chat sin configurar previamente modelos para una cuenta nueva.
4. Tokens de API#
En la pantalla de tokens de API, cada fila de la tabla ahora incluye un ícono para regenerar el secreto. Después de la confirmación, el valor antiguo del token deja de funcionar y el nuevo se muestra una sola vez.
El diálogo de creación y edición del token de API ahora sigue los colores y clases del tema del brandbook: los campos y botones se leen correctamente en tema oscuro. Se corrigieron el texto de confirmación para la regeneración del secreto y el error de acceso 403 al invocar el método de regeneración.
La regeneración del secreto también está disponible por API:
POST /api/v1/api_tokens/{api_token_guid}/regenerate
Esto simplifica la rotación segura de claves de integración sin crear un nuevo registro de token.
5. Creación de cuentas#
En la pantalla Cuentas, al crear una cuenta secundaria, ahora se puede habilitar la copia de modelos y de instancias de modelos desde la cuenta principal. El formulario incluye la casilla correspondiente; la API usa el parámetro copy_models_and_instances en POST /api/v1/accounts.
Esto acelera el despliegue de cuentas nuevas con un conjunto de modelos ya configurado.
6. Pantalla Modelos#
Al eliminar un modelo, sus instancias ahora se marcan como eliminadas en cascada. El nombre de la instancia de un modelo eliminado ya no bloquea la creación de un nuevo modelo con el mismo nombre.
Se aclaró la etiqueta del campo de instancia del modelo: “Subpath” (continuación de la ruta), no “Sub path”.
Esto reduce la confusión al configurar proveedores externos y facilita la reutilización de nombres.
7. Menú lateral#
Se restauró el ícono de rayo para la sección Asistentes en el menú lateral, en lugar del ícono de usuarios.
Esto ayuda a distinguir más rápido la sección de asistentes de los elementos cercanos del menú.
8. Limpieza de runs atascados#
Se agregó una limpieza periódica de runs en los estados waiting e in_progress que sean más antiguos que el tiempo configurado (24 horas por defecto). La tarea se ejecuta como un job en segundo plano de supervisord; para ejecución manual está disponible el CLI backend/bin/run-stuck-cleanup.php.
Los parámetros pueden configurarse por el administrador mediante las variables de entorno RUN_STUCK_TTL_HOURS y RUN_STUCK_CLEANUP_INTERVAL_SECONDS.
No hay nuevas pantallas del producto para este cambio. Ayuda a los administradores a mantener la estabilidad de instalaciones de larga duración y a evitar la acumulación de conversaciones “atascadas”.
9. OCR e imagen Docker del LLM#
El límite de páginas de OCR de PDF (PDF_OCR_MAX_PAGES, 1000 por defecto) y los demás parámetros operativos de OCR se trasladaron a archivos .env.* documentados.
La imagen Docker del modelo de lenguaje local se actualizó a Python 3.13 y al stack alineado de vLLM 0.27.1, con verificación de dependencias y un smoke import durante la compilación.
No hay nuevas pantallas del producto para estos cambios. Esto facilita a los administradores la configuración de OCR y la actualización del entorno GPU.
10. Envío seguro de datos al LLM externo#
Para los agent runs a través de un LLM externo de DIT, los datos salientes se sanitizan antes de llamar a chat/completions: el código aiserver_python se elimina del historial y el contenido de los mensajes de herramientas se trunca teniendo en cuenta UTF-8. El modo se activa automáticamente para conexiones DIT/i.moscow y mediante la variable de entorno LLM_OUTBOUND_SANITIZE_TOOL_PAYLOADS=1 (descrita en .env.*).
Esto reduce el riesgo de enviar datos técnicos adicionales a un proveedor externo y mejora la estabilidad de las integraciones.
11. Documentación de API mejorada#
La documentación Swagger para POST /api/v1/folders/{folder_guid}/files/{file_guid}/chunks ahora describe el cuerpo vacío {}, la sustitución de account_guid en el servidor y la diferencia con addChunk; también se agregaron las respuestas 400, 500 y 501.
La documentación de API está disponible en Swagger: https://aiserver.sherparpa.ru/api/docs/swagger
Esto simplifica las integraciones y reduce los errores de validación al trabajar mediante Swagger o curl.