Versión 2.4.8#
Ya está disponible una nueva versión de Sherpa AI Server: Versión 2.4.8.
1. Panel de artefactos en el chat#
Se agregó un panel lateral de Artefactos en la pantalla Chat. En él se muestran los archivos creados durante el trabajo del Asistente, incluso si no tienen un enlace separado en el texto de la respuesta. El panel se actualiza al finalizar la solicitud y además verifica los archivos que aparecen con retraso.
En dispositivos móviles, el panel no ocupa espacio en el área de conversación: se puede abrir desde el menú Abrir artefactos en el encabezado del chat.
Esto ayuda a encontrar y descargar de inmediato los resultados del Asistente sin revisar toda la conversación.
2. Interfaz actualizada de la pantalla Chat#
Se rediseñó el área central de conversación en la pantalla Chat: los mensajes se agrupan en una cinta compacta centrada con un ancho limitado de la columna de texto, se mejoró la legibilidad de Markdown y las respuestas habituales del Asistente se muestran sin una tarjeta aparte.
Para el texto seleccionado en los mensajes, se agregó un panel flotante con las acciones Copiar e insertar cita en el campo de entrada. Las acciones secundarias se agrupan en el menú +, el título de la conversación actual se muestra en un panel compacto del chat y la eliminación de mensajes se movió a un menú adicional. En los mensajes del día actual se muestra solo la hora, sin la fecha. Se redujo la altura máxima del campo de entrada en computadoras y dispositivos móviles, conservando el desplazamiento interno.
Esto facilita la lectura de respuestas largas, el trabajo con citas y hace que el campo de entrada se vea más ordenado en computadoras y dispositivos móviles.
3. Encabezado del chat y bloque compacto del Asistente#
En la pantalla Chat, el nombre de la conversación volvió a la parte izquierda del encabezado y el bloque compacto del Asistente se ubicó a la derecha, junto al botón de configuración. El bloque muestra archivos, MCP, paquetes y el modelo; al pasar el cursor se muestran tooltips con información detallada.
Los datos detallados del Asistente se trasladaron del encabezado a un tooltip compacto: se abre al hacer clic en el nombre del Asistente o en el botón de información y se cierra al hacer clic fuera del bloque. Se corrigieron el solapamiento del tooltip con los mensajes, el espacio vacío a la izquierda del nombre del chat y el desbordamiento del botón de configuración en pantallas angostas.
En un chat existente, el cambio y la desvinculación del Asistente ahora están disponibles mediante un modal con tarjetas como en la pantalla Asistentes: búsqueda, icono y color, modelo, elementos fijados en la parte superior, contadores de archivos, carpetas, MCP y paquetes. El modo de chat seleccionado para la conversación actual se conserva y se restaura después de navegar entre páginas.
Esto ayuda a entender más rápido con qué Asistente se está conversando y a cambiar de Asistente de forma segura sin perder el contexto del chat.
4. Actualización en vivo del chat y respuesta externa del Asistente#
Se corrigió la actualización en vivo en la pantalla Chat para los Asistentes que responden mediante API: mientras la ejecución está activa, se muestra un indicador de espera y, después de finalizar, los mensajes se cargan sin actualizar la página.
Mientras una solicitud externa está en estado de espera u otro estado incompleto, el reenvío y el cambio de Asistente se bloquean igual que durante una ejecución interna. Ya no se llaman métodos adicionales de inicio en el servidor para un Asistente con respuesta API externa.
Esto hace que las integraciones sean más predecibles y reduce el riesgo de solicitudes duplicadas.
5. Envío de audio y video largos#
Se corrigió el envío de mensajes con audio y video largos en la pantalla Chat: la interfaz espera la transcripción hasta 10 minutos y reanuda la ejecución si se interrumpe la solicitud o se vuelve a abrir el chat.
Esto ayuda a completar conversaciones con archivos multimedia largos sin refrescar manualmente la página.
6. Pantalla Usuarios#
En la pantalla Usuarios, la tabla ahora incluye columnas para los roles y el estado de actividad del usuario.
Esto ayuda al administrador a evaluar rápidamente los permisos y el estado de la cuenta sin abrir la tarjeta del usuario.
7. Pantalla Modelos#
En el diálogo de creación y edición de modelos de la pantalla Modelos, se agregaron parámetros de generación: preset, temperature, top_p, top_k, min_p, presence_penalty, repetition_penalty y sampling_max_tokens. Los campos incluyen tooltips en ruso e inglés.
También se agregó la configuración chat_template_kwargs para pasar parámetros adicionales de la plantilla del chat a instancias externas de modelos compatibles con OpenAI; el valor se puede establecer en la configuración del modelo o mediante la variable de entorno LLM_CHAT_TEMPLATE_KWARGS.
Esto simplifica el ajuste fino de la generación y la integración con proveedores externos sin editar la configuración del servidor para cada modelo.
8. Configuración del Asistente y widget incrustable#
En la configuración del Asistente, en la pestaña Widget, se agregó el interruptor Ocultar bloques “Pensando...” en el widget: cuando está activado, el panel de razonamiento se oculta para los usuarios finales del widget, mientras que la generación de la respuesta en el servidor no cambia.
En la pantalla de edición del Asistente, el campo de prompt del sistema recibió un gran asa de redimensionamiento, útil para instrucciones largas y para el tema oscuro.
Se corrigió la configuración del moderador: el conjunto de reglas seleccionado ahora se guarda correctamente y el valor Sin moderación permite quitar un moderador asignado previamente.
Esto ayuda al administrador a controlar lo que ven los usuarios del widget, editar prompts largos con más comodidad y configurar la moderación de respuestas sin errores.
9. Menú lateral y navegación#
En el menú lateral se actualizaron los iconos de las secciones Asistentes, Historial de chats, Roles, Cuentas y Modelos para que los elementos se distingan en el modo compacto sin etiquetas.
El logotipo del portal ahora es un enlace para crear una nueva conversación. Después de iniciar sesión, si no se especifica un returnUrl explícito, se abre un chat nuevo en lugar del historial de chats. La sugerencia de selección con Ctrl/Shift en el menú lateral solo se muestra al pasar el cursor o enfocar dentro de él.
En la localización en ruso, Nombre del ayudante se reemplazó por Nombre del asistente para mantener la consistencia de la terminología en toda la interfaz.
Esto simplifica la navegación y hace que la interfaz sea más clara tanto en computadoras como en dispositivos móviles.
10. Notificaciones#
Se actualizó el diseño de las notificaciones emergentes: tarjetas compactas y adaptables con tipografía moderna, sombra suave, barra de estado y un cierre siempre disponible con la cruz. Se muestran como máximo tres mensajes a la vez; las notificaciones de error usan una superficie neutra con un acento rojo y las advertencias usan una paleta amarilla.
Esto hace que los mensajes de error y advertencia sean más visibles y visualmente más ordenados.
11. Vinculación de archivos a conversaciones#
Se corrigió el manejo de archivos en el chat: el método POST /api/v1/threads/{thread_guid}/files con file_guids vincula un archivo a través de la tabla thread_files sin cambiar la carpeta de origen. Un mismo archivo puede participar en varias conversaciones y la base de conocimiento del Asistente no se vacía.
Los archivos de file_guids en un mensaje del usuario se vinculan automáticamente a la conversación para que las herramientas del agente puedan ver el adjunto. Limpiar o eliminar una carga en la carpeta de la conversación no elimina el archivo del disco si todavía está vinculado a otras conversaciones.
Esto ayuda a compartir documentos entre chats de forma segura y evita que los archivos se pierdan de la base de conocimiento del Asistente.
12. Acceso a carpetas de objetos por roles#
Al iniciar sesión como usuario, la lista de carpetas de objetos se limita a la unión de las carpetas disponibles en todos los roles del usuario. Al iniciar sesión como cuenta, siguen viéndose todas las carpetas de la cuenta; los objetos sin carpeta siguen disponibles.
Esto mejora la seguridad y se ajusta a los permisos asignados a los roles.
13. Mejoras en escenarios de agente#
Se corrigió un error por el que los escenarios de agente podían entrar en bucle o no devolver una respuesta cuando el esquema de herramientas requería thread_guid: el servidor sigue insertando el GUID de la conversación actual antes de la ejecución.
Se actualizó el modo de selección de herramientas para los modelos con razonamiento. Si un modelo informa una llamada a herramienta pero no devuelve un comando reconocido, la ejecución finaliza con un error de diagnóstico. Se agregó compactación del contexto del agente: los resultados grandes de las herramientas se limitan antes de enviarlos al modelo y, cuando el contexto se desborda, el historial se comprime con un breve resumen del progreso.
Se corrigió la finalización de solicitudes del agente después de llamadas MCP: el límite para resultados grandes se aplica solo a la copia usada por el modelo, el historial completo se conserva y el desbordamiento del contexto se muestra por separado del error general.
Esto mejora la estabilidad de los escenarios de agente y reduce el riesgo de tiempos de espera en cadenas largas de herramientas.
14. Intérprete de código#
El intérprete de Python ya no ejecuta código de los bloques internos de razonamiento de la respuesta del modelo; un bloque de razonamiento sin cerrar también queda excluido de la respuesta ejecutable.
Esto evita la ejecución accidental de texto de razonamiento como código Python.
15. Documentación de API mejorada#
Se actualizaron las descripciones de OpenAPI para la indexación automática y manual durante la carga de archivos, el modo especial para medios transcribibles y todos los valores del estado del archivo.
También se aclararon las descripciones de la creación de chats, las instancias de modelos, la carga de archivos en carpetas con object_folder_guid, el parámetro multipart force para el intérprete y los escenarios de clave de API frente a sesión de GUI.
La documentación de API está disponible en Swagger: https://aiserver.sherparpa.ru/api/docs/swagger
Esto facilita las integraciones y reduce los errores de validación al trabajar a través de Swagger o curl.
16. Confiabilidad y seguridad de la API#
El método GET /api/v1/threads ya no devuelve un error 500 si los campos info o metadata en la base de datos se almacenan en un formato de cadena heredado.
Ya no es posible actualizar o volver a vincular una ejecución a la conversación de otra cuenta mediante solicitudes PUT y PATCH. Las rutas de prueba de la API y sus descripciones de OpenAPI solo están disponibles cuando el modo de depuración de la aplicación está activado.
Se corrigió la solicitud de búsqueda de archivos del bloque Designer, Buscar embeddings: los parámetros heredados se convierten al formato de la API v1.
Esto mejora la estabilidad de actualización de Sherpa AI Server y la seguridad de las instalaciones con varias cuentas.
17. Instalación, actualización y GPU#
Durante la instalación y las actualizaciones con GPU, el perfil compose gpu siempre se activa para que se inicie el servicio local de modelo de lenguaje, incluso cuando no se usan Whisper y reranker.
El tiempo de espera de la API de Nginx se aumentó a 600 segundos en todos los entornos, y también se aumentó el tiempo de espera de conexión predeterminado de LLM. La plantilla .env.main se actualizó para el lanzamiento oficial de Qwen3.6 en vLLM.
No hay nuevas pantallas del producto para estos cambios: el resultado es visible para los administradores en solicitudes largas más estables, una instalación correcta de GPU y las instrucciones actualizadas de configuración del entorno.