Versão 2.4.9#

Uma nova versão do Sherpa AI Server já está disponível: Versão 2.4.9.

1. Confiabilidade da tela Chat#

Na tela Chat, o indicador de atividade não desaparece mais enquanto o run está ativo. Se ocorrer um erro, o fluxo mostra o texto do erro e o botão Repetir.

O título da conversa agora é construído a partir da primeira mensagem do usuário, em vez de um fragmento do documento; tópicos inventados pelo modelo de linguagem são descartados. A geração do título não falha mais com erro 500 em uma resposta longa de um modelo de raciocínio: o bloco interno de raciocínio não fechado é removido e o título é truncado para 256 caracteres.

Isso ajuda a entender o estado da conversa, recuperar-se mais rápido após uma falha e ver nomes de chat mais significativos.

2. Fontes de resposta do Assistente#

Na tela Chat, os chunks técnicos de RAG ficam ocultos em um bloco recolhido de fontes de resposta. O bloco pode ser expandido; no estado expandido, ele ocupa toda a largura da área de resposta e mostra as fontes em três colunas.

Isso facilita a leitura da resposta do Assistente e mantém as fontes técnicas disponíveis quando necessário.

3. Configurações do chat e modelo padrão#

Se uma conta não tiver modelos próprios, as configurações do chat exibem o modelo padrão do ambiente do Sherpa AI Server.

Isso ajuda a começar a trabalhar no chat sem configurar modelos previamente para uma conta nova.

4. Tokens de API#

Na tela de tokens de API, cada linha da tabela agora inclui um ícone de regeneração do segredo. Após a confirmação, o valor antigo do token deixa de funcionar e o novo é exibido apenas uma vez.

O diálogo de criação e edição de token de API agora segue as cores e classes do tema do brandbook: os campos e botões permanecem legíveis no tema escuro. O texto de confirmação para regeneração do segredo e o erro de acesso 403 ao invocar o método de regeneração foram corrigidos.

A regeneração do segredo também está disponível pela API:

POST /api/v1/api_tokens/{api_token_guid}/regenerate

Isso simplifica a rotação segura de chaves de integração sem criar um novo registro de token.

5. Criação de conta#

Na tela Contas, ao criar uma conta filha, agora é possível ativar a cópia de modelos e instâncias de modelos da conta pai. O formulário inclui a caixa de seleção correspondente; a API usa o parâmetro copy_models_and_instances em POST /api/v1/accounts.

Isso acelera a implantação de novas contas com um conjunto de modelos já configurado.

6. Tela Modelos#

Ao excluir um modelo, suas instâncias agora são marcadas como excluídas em cascata. O nome da instância de um modelo excluído não bloqueia mais a criação de um novo modelo com o mesmo nome.

O rótulo do campo de instância do modelo foi esclarecido: “Subpath” (continuação do caminho), e não “Sub path”.

Isso reduz a confusão ao configurar provedores externos e facilita o reaproveitamento de nomes.

7. Menu lateral#

O ícone de raio foi restaurado para a seção Assistentes no menu lateral, em vez do ícone de usuários.

Isso ajuda a distinguir mais rapidamente a seção de assistentes dos itens vizinhos do menu.

8. Limpeza de runs travados#

Foi adicionada uma limpeza periódica de runs nos status waiting e in_progress que estejam mais antigos do que o tempo configurado (24 horas por padrão). A tarefa é executada como um job em segundo plano do supervisord; para execução manual, o CLI backend/bin/run-stuck-cleanup.php está disponível.

Os parâmetros podem ser configurados pelo administrador por meio das variáveis de ambiente RUN_STUCK_TTL_HOURS e RUN_STUCK_CLEANUP_INTERVAL_SECONDS.

Não há novas telas do produto para esta mudança. Isso ajuda os administradores a manter a estabilidade de instalações de longa duração e a evitar o acúmulo de conversas “travadas”.

9. OCR e imagem Docker do LLM#

O limite de páginas de OCR de PDF (PDF_OCR_MAX_PAGES, 1000 por padrão) e os demais parâmetros operacionais de OCR foram movidos para arquivos .env.* documentados.

A imagem Docker do modelo de linguagem local foi atualizada para Python 3.13 e para a stack alinhada do vLLM 0.27.1, com verificação de dependências e smoke import durante a build.

Não há novas telas do produto para estas mudanças. Isso facilita para os administradores a configuração de OCR e a atualização do ambiente de GPU.

10. Envio seguro de dados para o LLM externo#

Para os agent runs por meio de um LLM externo da DIT, os dados de saída são sanitizados antes da chamada a chat/completions: o código aiserver_python é removido do histórico e o conteúdo das mensagens de ferramenta é truncado com consideração a UTF-8. O modo é ativado automaticamente para conexões DIT/i.moscow e por meio da variável de ambiente LLM_OUTBOUND_SANITIZE_TOOL_PAYLOADS=1 (descrita em .env.*).

Isso reduz o risco de enviar dados técnicos extras para um provedor externo e melhora a estabilidade das integrações.

11. Documentação de API aprimorada#

A documentação Swagger para POST /api/v1/folders/{folder_guid}/files/{file_guid}/chunks agora descreve o corpo vazio {}, a substituição de account_guid pelo servidor e a diferença em relação a addChunk; também foram adicionadas as respostas 400, 500 e 501.

A documentação da API está disponível no Swagger: https://aiserver.sherparpa.ru/api/docs/swagger

Isso simplifica as integrações e reduz erros de validação ao trabalhar pelo Swagger ou curl.