Versão 2.4.9#
Uma nova versão do Sherpa AI Server já está disponível: Versão 2.4.9.
1. Confiabilidade da tela Chat#
Na tela Chat, o indicador de atividade não desaparece mais enquanto o run está ativo. Se ocorrer um erro, o fluxo mostra o texto do erro e o botão Repetir.
O título da conversa agora é construído a partir da primeira mensagem do usuário, em vez de um fragmento do documento; tópicos inventados pelo modelo de linguagem são descartados. A geração do título não falha mais com erro 500 em uma resposta longa de um modelo de raciocínio: o bloco interno de raciocínio não fechado é removido e o título é truncado para 256 caracteres.
Isso ajuda a entender o estado da conversa, recuperar-se mais rápido após uma falha e ver nomes de chat mais significativos.
2. Fontes de resposta do Assistente#
Na tela Chat, os chunks técnicos de RAG ficam ocultos em um bloco recolhido de fontes de resposta. O bloco pode ser expandido; no estado expandido, ele ocupa toda a largura da área de resposta e mostra as fontes em três colunas.
Isso facilita a leitura da resposta do Assistente e mantém as fontes técnicas disponíveis quando necessário.
3. Configurações do chat e modelo padrão#
Se uma conta não tiver modelos próprios, as configurações do chat exibem o modelo padrão do ambiente do Sherpa AI Server.
Isso ajuda a começar a trabalhar no chat sem configurar modelos previamente para uma conta nova.
4. Tokens de API#
Na tela de tokens de API, cada linha da tabela agora inclui um ícone de regeneração do segredo. Após a confirmação, o valor antigo do token deixa de funcionar e o novo é exibido apenas uma vez.
O diálogo de criação e edição de token de API agora segue as cores e classes do tema do brandbook: os campos e botões permanecem legíveis no tema escuro. O texto de confirmação para regeneração do segredo e o erro de acesso 403 ao invocar o método de regeneração foram corrigidos.
A regeneração do segredo também está disponível pela API:
POST /api/v1/api_tokens/{api_token_guid}/regenerate
Isso simplifica a rotação segura de chaves de integração sem criar um novo registro de token.
5. Criação de conta#
Na tela Contas, ao criar uma conta filha, agora é possível ativar a cópia de modelos e instâncias de modelos da conta pai. O formulário inclui a caixa de seleção correspondente; a API usa o parâmetro copy_models_and_instances em POST /api/v1/accounts.
Isso acelera a implantação de novas contas com um conjunto de modelos já configurado.
6. Tela Modelos#
Ao excluir um modelo, suas instâncias agora são marcadas como excluídas em cascata. O nome da instância de um modelo excluído não bloqueia mais a criação de um novo modelo com o mesmo nome.
O rótulo do campo de instância do modelo foi esclarecido: “Subpath” (continuação do caminho), e não “Sub path”.
Isso reduz a confusão ao configurar provedores externos e facilita o reaproveitamento de nomes.
7. Menu lateral#
O ícone de raio foi restaurado para a seção Assistentes no menu lateral, em vez do ícone de usuários.
Isso ajuda a distinguir mais rapidamente a seção de assistentes dos itens vizinhos do menu.
8. Limpeza de runs travados#
Foi adicionada uma limpeza periódica de runs nos status waiting e in_progress que estejam mais antigos do que o tempo configurado (24 horas por padrão). A tarefa é executada como um job em segundo plano do supervisord; para execução manual, o CLI backend/bin/run-stuck-cleanup.php está disponível.
Os parâmetros podem ser configurados pelo administrador por meio das variáveis de ambiente RUN_STUCK_TTL_HOURS e RUN_STUCK_CLEANUP_INTERVAL_SECONDS.
Não há novas telas do produto para esta mudança. Isso ajuda os administradores a manter a estabilidade de instalações de longa duração e a evitar o acúmulo de conversas “travadas”.
9. OCR e imagem Docker do LLM#
O limite de páginas de OCR de PDF (PDF_OCR_MAX_PAGES, 1000 por padrão) e os demais parâmetros operacionais de OCR foram movidos para arquivos .env.* documentados.
A imagem Docker do modelo de linguagem local foi atualizada para Python 3.13 e para a stack alinhada do vLLM 0.27.1, com verificação de dependências e smoke import durante a build.
Não há novas telas do produto para estas mudanças. Isso facilita para os administradores a configuração de OCR e a atualização do ambiente de GPU.
10. Envio seguro de dados para o LLM externo#
Para os agent runs por meio de um LLM externo da DIT, os dados de saída são sanitizados antes da chamada a chat/completions: o código aiserver_python é removido do histórico e o conteúdo das mensagens de ferramenta é truncado com consideração a UTF-8. O modo é ativado automaticamente para conexões DIT/i.moscow e por meio da variável de ambiente LLM_OUTBOUND_SANITIZE_TOOL_PAYLOADS=1 (descrita em .env.*).
Isso reduz o risco de enviar dados técnicos extras para um provedor externo e melhora a estabilidade das integrações.
11. Documentação de API aprimorada#
A documentação Swagger para POST /api/v1/folders/{folder_guid}/files/{file_guid}/chunks agora descreve o corpo vazio {}, a substituição de account_guid pelo servidor e a diferença em relação a addChunk; também foram adicionadas as respostas 400, 500 e 501.
A documentação da API está disponível no Swagger: https://aiserver.sherparpa.ru/api/docs/swagger
Isso simplifica as integrações e reduz erros de validação ao trabalhar pelo Swagger ou curl.