Versão 2.4.8#

Uma nova versão do Sherpa AI Server já está disponível: Versão 2.4.8.

1. Painel de artefatos no chat#

Foi adicionado um painel lateral de Artefatos na tela Chat. Ele exibe os arquivos criados durante o trabalho do Assistente, inclusive os que não têm um link separado no texto da resposta. O painel é atualizado após a conclusão da solicitação e também verifica os arquivos que aparecem com atraso.

Em dispositivos móveis, o painel não ocupa espaço na área de conversa: ele pode ser aberto pelo menu Abrir artefatos no cabeçalho do chat.

Isso ajuda a encontrar e baixar imediatamente os resultados do Assistente sem revisar toda a conversa.

2. Interface atualizada da tela Chat#

A área central de conversa na tela Chat foi redesenhada: as mensagens são agrupadas em um fluxo compacto centralizado com largura limitada da coluna de texto, a legibilidade do Markdown foi melhorada e as respostas normais do Assistente são exibidas sem um cartão separado.

Para o texto selecionado nas mensagens, foi adicionado um painel flutuante com as ações Copiar e inserir citação no campo de entrada. As ações secundárias foram agrupadas no menu +, o título da conversa atual é exibido em um painel compacto do chat e a exclusão de mensagens foi movida para um menu adicional. Nas mensagens do dia atual, é exibida apenas a hora, sem a data. A altura máxima do campo de entrada foi reduzida em computadores e dispositivos móveis, mantendo a rolagem interna.

Isso facilita a leitura de respostas longas, o trabalho com citações e deixa o campo de entrada mais organizado em computadores e dispositivos móveis.

3. Cabeçalho do chat e bloco compacto do Assistente#

Na tela Chat, o nome da conversa voltou para o lado esquerdo do cabeçalho, e o bloco compacto do Assistente foi posicionado à direita, ao lado do botão de configurações. O bloco mostra arquivos, MCP, pacotes e o modelo; ao passar o mouse, são exibidas dicas com informações detalhadas.

Os dados detalhados do Assistente foram movidos do cabeçalho para uma dica compacta: ela é aberta ao clicar no nome do Assistente ou no botão de informações e é fechada ao clicar fora do bloco. Foram corrigidos o sobreposição da dica com as mensagens, o espaço vazio à esquerda do nome do chat e o estouro do botão de configurações em telas estreitas.

Em um chat existente, a troca e o desvinculamento do Assistente agora estão disponíveis por meio de um modal com cartões como na tela Assistentes: busca, ícone e cor, modelo, itens fixados no topo, contadores de arquivos, pastas, MCP e pacotes. O modo de chat selecionado para a conversa atual é preservado e restaurado após a navegação entre páginas.

Isso ajuda a entender mais rapidamente com qual Assistente a conversa está acontecendo e a trocar de Assistente com segurança sem perder o contexto do chat.

4. Atualização em tempo real do chat e resposta externa do Assistente#

A atualização em tempo real na tela Chat foi corrigida para Assistentes que respondem por API: enquanto a execução está ativa, um indicador de espera é exibido e, após a conclusão, as mensagens são carregadas sem atualizar a página.

Enquanto uma solicitação externa estiver em status de espera ou em outro estado não concluído, o reenvio e a troca do Assistente ficam bloqueados da mesma forma que durante uma execução interna. Nenhum método adicional de início no servidor é mais chamado para um Assistente com resposta externa de API.

Isso torna as integrações mais previsíveis e reduz o risco de solicitações duplicadas.

5. Envio de áudio e vídeo longos#

O envio de mensagens com áudio e vídeo longos foi corrigido na tela Chat: a interface aguarda a transcrição por até 10 minutos e retoma a execução se a solicitação for interrompida ou o chat for reaberto.

Isso ajuda a concluir conversas com anexos de mídia longos sem atualizar a página manualmente.

6. Tela Usuários#

Na tela Usuários, a tabela agora inclui colunas para funções e status de atividade do usuário.

Isso ajuda o administrador a avaliar rapidamente permissões e estado da conta sem abrir o cartão do usuário.

7. Tela Modelos#

No diálogo de criação e edição de modelo na tela Modelos, foram adicionados parâmetros de geração: preset, temperature, top_p, top_k, min_p, presence_penalty, repetition_penalty e sampling_max_tokens. Os campos incluem dicas em russo e inglês.

Também foi adicionada a configuração chat_template_kwargs para passar parâmetros adicionais do modelo de chat para instâncias externas de modelo compatíveis com OpenAI; o valor pode ser definido nas configurações do modelo ou por meio da variável de ambiente LLM_CHAT_TEMPLATE_KWARGS.

Isso simplifica o ajuste fino da geração e a integração com provedores externos sem editar a configuração do servidor para cada modelo.

8. Configurações do Assistente e widget incorporável#

Nas configurações do Assistente, na aba Widget, foi adicionado o botão de alternância Ocultar blocos “Pensando...” no widget: quando ativado, o painel de raciocínio fica oculto para os usuários finais do widget, enquanto a geração da resposta no servidor não muda.

Na tela de edição do Assistente, o campo de prompt do sistema recebeu uma alça grande de redimensionamento, útil para instruções longas e para o tema escuro.

A configuração do moderador foi corrigida: o conjunto de regras selecionado agora é salvo corretamente, e o valor Sem moderação permite remover um moderador atribuído anteriormente.

Isso ajuda o administrador a controlar o que os usuários do widget veem, editar prompts longos com mais conforto e configurar a moderação de respostas sem erros.

9. Menu lateral e navegação#

Os ícones das seções Assistentes, Histórico de chats, Funções, Contas e Modelos foram atualizados no menu lateral para que os itens continuem distinguíveis no modo compacto sem rótulos.

O logotipo do portal agora é um link para criar uma nova conversa. Após o login, se nenhum returnUrl explícito for especificado, um novo chat é aberto em vez do histórico de chats. A dica de seleção com Ctrl/Shift no menu lateral só é exibida ao passar o mouse ou focar dentro dele.

Na localização em russo, o rótulo foi padronizado como Nome do assistente para manter a consistência da terminologia em toda a interface.

Isso simplifica a navegação e torna a interface mais clara tanto em computadores quanto em dispositivos móveis.

10. Notificações#

O design das notificações pop-up foi atualizado: cartões compactos e responsivos com tipografia moderna, sombra suave, barra de status e fechamento sempre disponível pelo X. No máximo três mensagens são exibidas ao mesmo tempo; as notificações de erro usam uma superfície neutra com destaque vermelho, e os avisos usam uma paleta amarela.

Isso torna as mensagens de erro e aviso mais visíveis e visualmente mais organizadas.

11. Vinculação de arquivos a conversas#

O trabalho com arquivos no chat foi corrigido: o método POST /api/v1/threads/{thread_guid}/files com file_guids vincula o arquivo pela tabela thread_files sem alterar a pasta de origem. Um mesmo arquivo pode participar de várias conversas, e a base de conhecimento do Assistente não é esvaziada.

Os arquivos de file_guids em uma mensagem do usuário são vinculados automaticamente à conversa para que as ferramentas do agente vejam o anexo. Limpar ou remover um upload na pasta da conversa não exclui o arquivo do disco se ele ainda estiver vinculado a outras conversas.

Isso ajuda a compartilhar documentos entre chats com segurança e evita que arquivos sejam perdidos da base de conhecimento do Assistente.

12. Acesso a pastas de objetos por função#

Ao autenticar-se como usuário, a lista de pastas de objetos é limitada à união das pastas disponíveis em todas as funções do usuário. Ao autenticar-se como conta, todas as pastas da conta continuam visíveis; os objetos sem pasta permanecem disponíveis.

Isso aumenta a segurança e corresponde às permissões atribuídas às funções.

13. Melhorias nos cenários de agente#

Foi corrigido um erro em que os cenários de agente podiam entrar em loop ou não retornar uma resposta quando o esquema de ferramentas exigia thread_guid: o servidor ainda insere o GUID da conversa atual antes da execução.

O modo de seleção de ferramentas para modelos com raciocínio foi atualizado. Se um modelo informa uma chamada de ferramenta, mas não retorna um comando reconhecido, a execução termina com um erro de diagnóstico. Foi adicionada a compactação do contexto do agente: resultados grandes de ferramentas são limitados antes de serem enviados ao modelo e, quando o contexto transborda, o histórico é compactado com um breve resumo do progresso.

A finalização das solicitações do agente após chamadas MCP foi corrigida: o limite para resultados grandes é aplicado apenas à cópia usada pelo modelo, o histórico completo é preservado e o transbordamento de contexto é mostrado separadamente do erro geral.

Isso melhora a estabilidade dos cenários de agente e reduz o risco de timeouts em cadeias longas de ferramentas.

14. Interpretador de código#

O interpretador Python não executa mais código dos blocos internos de raciocínio na resposta do modelo; um bloco de raciocínio não fechado também é excluído da resposta executável.

Isso evita a execução acidental de texto de raciocínio como código Python.

15. Documentação de API aprimorada#

As descrições OpenAPI foram atualizadas para a indexação automática e manual durante o upload de arquivos, o modo especial para mídias transcritíveis e todos os valores de status de arquivo.

Também foram esclarecidas as descrições para criação de chats, instâncias de modelo, upload de arquivos em pastas com object_folder_guid, o parâmetro multipart force para o interpretador e os cenários de chave de API versus sessão de GUI.

A documentação da API está disponível no Swagger: https://aiserver.sherparpa.ru/api/docs/swagger

Isso simplifica as integrações e reduz erros de validação ao trabalhar pelo Swagger ou curl.

16. Confiabilidade e segurança da API#

O método GET /api/v1/threads não retorna mais erro 500 se os campos info ou metadata no banco de dados estiverem armazenados em um formato de string legado.

Não é mais possível atualizar ou vincular novamente uma execução à conversa de outra conta por meio de solicitações PUT e PATCH. As rotas de teste da API e suas descrições OpenAPI ficam disponíveis apenas quando o modo de depuração do aplicativo está ativado.

A solicitação de busca de arquivos do bloco Designer, Encontrar embeddings, foi corrigida: parâmetros legados são convertidos para o formato da API v1.

Isso melhora a estabilidade da atualização do Sherpa AI Server e a segurança das instalações com várias contas.

17. Instalação, atualização e GPU#

Durante a instalação e atualização com GPU, o perfil compose gpu é sempre ativado para que o serviço local de modelo de linguagem seja iniciado, inclusive quando Whisper e reranker não são usados.

O tempo limite da API do Nginx em todos os ambientes foi aumentado para 600 segundos, e o tempo limite padrão de conexão com o LLM também foi aumentado. O modelo .env.main foi atualizado para o lançamento oficial do Qwen3.6 no vLLM.

Não há novas telas do produto para essas alterações: o resultado é visível para os administradores em solicitações longas mais estáveis, instalação correta de GPU e instruções de configuração do ambiente atualizadas.