Modelos#
A tela Modelos é destinada ao gerenciamento de Modelos e Instâncias de modelos disponíveis no Sherpa AI Server.
.png)
Os usuários podem escolher entre um Modelo local ou na nuvem, desde que tenham os tokens necessários para acesso. Também é possível integrar um Modelo hospedado em servidores de terceiros dentro da rede local (mas não no mesmo servidor onde o Sherpa AI Server está localizado).
| № p/p | Elemento da interface | Descrição |
|---|---|---|
| 1. | bloco "Modelos" | Área superior da tela, onde é exibida a lista de Modelos registrados no sistema. |
| 1.1. | botão "Criar" | Abre o formulário para criar um novo Modelo. |
| 1.2. | botão "Atualizar" | Atualiza a lista de Modelos. |
| 1.3. | botão "Excluir selecionados" | Permite excluir os Modelos selecionados. |
| 1.4. | botão "Exportar para CSV" | Exporta a lista de Modelos para um arquivo no formato CSV. |
| 1.5. | botão "Exportar para XLSX" | Exporta a lista de Modelos para um arquivo no formato XLSX. |
| 1.6. | checkbox de seleção de modelo ![]() | Permite selecionar um ou mais Modelos para realizar ações em grupo. |
| 1.7. | coluna "Nome" | Exibe o nome do Modelo. |
| 1.8. | coluna "Descrição" | Exibe a descrição do Modelo, se fornecida. |
| 1.9. | coluna "Tipo de modelo" | Define para que tipo de tarefas o Modelo é destinado. Possíveis opções:
|
| 1.10. | coluna "Destinos" | Mostra em quais cenários do sistema o Modelo pode ser utilizado.
|
| 1.11. | coluna "Parâmetro de geração" | Perfil de configuração de geração de resposta selecionado.
|
| 1.12. | coluna "Pasta de acesso" | Exibe a Pasta de acesso à qual o Modelo pertence. |
| 1.13. | coluna "Criado" | Exibe a data e hora de criação do Modelo. |
| 1.14. | coluna "Alterado" | Exibe a data e hora da última alteração do Modelo. |
| 1.15. | botão de edição ![]() | Permite abrir o Modelo selecionado para alterar os parâmetros. |
| 1.16. | botão de exclusão ![]() | Permite excluir um Modelo específico. |
| 2. | bloco "Instâncias de modelos" | Área inferior da tela, onde são exibidas as instâncias do Modelo selecionado. |
| 2.1. | checkbox de seleção de instância ![]() | Permite selecionar uma ou mais Instâncias de modelos para realizar ações em grupo. |
| 2.1. | botão "Criar" | Abre o formulário para criar uma nova Instância de modelo. |
| 2.2. | botão "Atualizar" | Atualiza a lista de Instâncias de modelos. |
| 2.3. | botão "Excluir selecionados" | Permite excluir as Instâncias de modelos selecionadas.
|
| 2.4. | botão "Exportar para CSV" | Exporta a lista de Instâncias de modelos para um arquivo no formato CSV. O botão está desativado se nenhuma instância for selecionada. |
| 2.5. | botão "Exportar para XLSX" | Exporta a lista de Instâncias de modelos para um arquivo no formato XLSX. O botão está desativado se nenhuma instância for selecionada. |
| 2.6. | coluna "Nome" | Exibe o nome da Instância de modelo. |
| 2.7. | coluna "Tipo" | Exibe o tipo da Instância de modelo, por exemplo local. |
| 2.8. | coluna "Localização" | Exibe o endereço ou localização da Instância de modelo, por exemplo aiserver-llm-server:8000. |
| 2.9. | coluna "Criado" | Exibe a data e hora de criação da Instância de modelo. |
| 2.10. | coluna "Alterado" | Exibe a data e hora da última alteração da Instância de modelo. |
| 2.12. | botão de edição ![]() | Permite abrir a Instância de modelo selecionada para alterar os parâmetros. |
| 2.13. | botão de exclusão ![]() | Permite excluir uma Instância de modelo específica. |
| 3. | ![]() | Permite especificar quantos registros serão exibidos na tabela em uma única página. |
| 4. | ![]() | Mostra o intervalo de registros exibidos na página atual e o número total de registros na tabela. |
| 5. | ![]() | Permite navegar entre as páginas da tabela:
|
Seleção de Modelo em outras telas do Sherpa AI Server#
Chat#
O campo "Modelo" na janela "Configurações de chat padrão" permite selecionar o Modelo que será usado por padrão para processar mensagens no Chat. O Modelo selecionado determina como o Sherpa AI Server irá formular respostas para o Usuário, executar instruções da mensagem do sistema e operar no modo definido.
.png)
Assistentes#
O campo "Modelo" na janela "Editar assistente" permite selecionar o Modelo que será usado pelo Assistente para formular respostas ao Usuário. O campo é obrigatório e é aplicado quando a opção "Responde o modelo" é selecionada no bloco "Fonte da resposta à pergunta do usuário".

Criar Modelo#
A janela pop-up "Criar modelo" é aberta após clicar no botão "Criar" acima da tabela "Modelos" e é destinada a adicionar um novo Modelo ao Sherpa AI Server.
.png)
| № p/p | Elemento da interface | Descrição |
| 1. | seção "Principais" | Contém os parâmetros básicos do Modelo a ser criado. |
| 1.2. | campo "Nome" | Campo obrigatório para inserir o nome do Modelo. |
| 1.3. | campo "Descrição" | Destinado à inserção de uma breve descrição do Modelo. |
| 1.4. | campo "Tipo de modelo" | Campo suspenso obrigatório, onde se escolhe a finalidade do Modelo a ser criado. O tipo selecionado determina para quais tarefas o modelo será utilizado no Sherpa AI Server:
|
| 1.5. | campo "Comprimento do contexto (tokens)" | Permite especificar o comprimento máximo do contexto do Modelo em tokens. Se o campo for deixado em branco, será utilizada a configuração global LLM_MAX_MODEL_LEN. |
| 1.6. | campo "Pastas de objetos" | Permite selecionar as Pastas de objetos para as quais o Modelo estará disponível. |
| 1.7. | bloco "Por padrão" | Permite marcar para quais tarefas o Modelo será utilizado por padrão:
Algumas opções podem estar inativas, pois não estão disponíveis para o tipo de Modelo selecionado ou a configuração atual. |
| 2. | seção "Parâmetros de geração (sampling)" | Contém as configurações de geração de resposta do Modelo. Esses parâmetros influenciam o estilo, a variabilidade, o comprimento e a consistência das respostas. |
| 2.1. | botão "Parâmetros de geração avançados" | Expande ou oculta as configurações detalhadas de geração. |
| 2.2. | campo "Preset" | Permite selecionar um conjunto pré-definido de parâmetros de geração.
|
| 2.3. | campo "Temperature" | Define a aleatoriedade da resposta. Quanto maior o valor, mais variadas e criativas serão as respostas; quanto menor o valor, mais estáveis e previsíveis serão. |
| 2.4. | campo "Top-p (nucleus)" | Limita a escolha de tokens aos mais prováveis, até que sua probabilidade total atinja o limite especificado. Um valor mais baixo torna as respostas mais rigorosas, enquanto um valor mais alto as torna mais livres. |
| 2.5. | campo "Top-k" | Limita a escolha do próximo token a um número especificado de tokens mais prováveis. Um valor 0 desativa essa limitação. |
| 2.6. | campo "Min-p" | Corta tokens com baixa probabilidade em relação ao melhor token. Um valor 0 desativa o parâmetro. |
| 2.7. | campo "Presence penalty" | Adiciona uma penalidade para tokens já encontrados e reduz a probabilidade de repetição de temas ou frases. |
| 2.8. | campo "Repetition penalty" | Adicionalmente penaliza a repetição de texto já gerado. Um valor 1.0 significa ausência de aumento da penalidade; valores acima de 1 reduzem mais as repetições. |
| 2.9. | campo "Max tokens da resposta" | Permite especificar o comprimento máximo de uma resposta do Modelo. Se o campo for deixado em branco, será utilizado o valor das configurações globais do sistema. |
| 3. | seção "Modo avançado" | Contém configurações adicionais do modelo, destinadas a uma configuração mais precisa do template de chat e dos parâmetros de transmissão de dados para o Modelo. |
| 3.1. | botão "Parâmetros do template JSON" | Expande ou oculta o bloco de configuração dos parâmetros do template de chat no formato JSON. |
| 3.2. | bloco "Parâmetros do chat template (JSON)" | Contém um campo para inserir parâmetros adicionais do template de chat no formato JSON. |
| 3.3. | campo "Chat template kwargs (JSON)" | Destinado à inserção de um objeto JSON de argumentos adicionais chat_template_kwargs, que são utilizados na formação de solicitações ao Modelo.Uma dica abaixo do campo explica que o objeto JSON inserido é passado para chat/completions como chat_template_kwargs, é combinado com a configuração LLM_CHAT_TEMPLATE_KWARGS do .env, e as chaves não devem se sobrepor. |
| 4. | botão "Cancelar" | Fecha a janela sem criar o Modelo e sem salvar os dados inseridos. |
| 5. | botão "OK" | Criar Modelo com os parâmetros especificados.
|
Criar Exemplar do modelo#
A janela pop-up "Criar exemplar" é destinada a adicionar um novo Exemplar do modelo no Sherpa AI Server.

| № p/p | Elemento da interface | Descrição |
| 1. | campo "Nome" | Campo obrigatório para inserir o nome da instância a ser criada. |
| 2. | campo "Descrição" | Destinado à inserção de uma breve descrição da instância do modelo. |
| 3. | interruptor "Local / Nuvem" | Permite escolher o tipo de hospedagem da instância do modelo: local ou na nuvem. |
| 4. | campo "Caminho para o modelo" | Destinado a indicar o caminho para o modelo, que será passado nas solicitações do protocolo OpenAI no parâmetro model. A dica fornece um exemplo de caminho: /model-store/meta-llama/Meta-Llama-3-8B-Instruct. |
| 5. | campo "Timeout" | Campo obrigatório para indicar o timeout de conexão em segundos. |
| 6. | seção "Conexão" | Contém as configurações de conexão com a instância do modelo. |
| 6.1. | campo "Tipo de conexão" | Campo suspenso obrigatório para escolher o método de conexão. |
| 6.2. | campo "Host" | Campo obrigatório para indicar o endereço do servidor local onde a instância do modelo está disponível. |
| 6.3. | campo "Porta" | Campo obrigatório para indicar a porta pela qual o servidor local da instância do modelo está acessível. |
| 6.4. | campo "Esquema" | Campo suspenso para escolher o esquema de conexão com o servidor. |
| 6.5. | campo "Subcaminho" | Destinado a indicar o prefixo do caminho para o protocolo OpenAI. A dica explica que, por exemplo, para o caminho |
| 6.6. | campo "Protocolo" | Campo suspenso obrigatório para escolher o protocolo de interação com a instância do modelo. |
| 7. | seção "Autorização" | Contém as configurações de autorização ao conectar-se à instância do modelo. |
| 7.1. | campo "Tipo de autorização" | Campo suspenso obrigatório para escolher o método de autorização. |
| 7.2. | botão "Verificar conexão" | Permite verificar a disponibilidade da instância do modelo e a correção das configurações de conexão fornecidas. |
| 8. | botão "Cancelar" | Fecha a janela sem criar a instância e sem salvar os dados inseridos. |
| 9. | botão "OK" | Criará a instância do modelo com as configurações especificadas. O botão está inativo se os campos obrigatórios não estiverem completamente preenchidos. |
Editar Modelo#
Para visualizar/editar as propriedades do grupo de Modelos, é necessário selecionar o grupo desejado na lista e clicar no botão
. Após isso, abrirá um formulário com as configurações do Modelo, onde podem ser feitas as alterações necessárias. Não há novos campos no Modelo criado anteriormente.
.png)
Editar Instância do modelo#
Para visualizar/editar as propriedades da Instância do modelo, é necessário selecionar a instância desejada na lista e clicar no botão
. Após isso, abrirá um formulário com as configurações da Instância do modelo, onde podem ser feitas as alterações necessárias. Não há novos campos na Instância do modelo criada anteriormente.
.png)
Se o agente reportar excesso de contexto#
O contexto inclui o histórico do chat, fragmentos de documentos e descrições de ferramentas. Parte da janela do modelo é reservada para a resposta. Portanto, uma pergunta curta pode ser acompanhada por uma solicitação grande.
Em compilações com correção de contagem exata, o agente verifica o tamanho da grande solicitação no tokenizador do modelo local antes de reduzir o contexto ou recusar. Se o tokenizador não estiver disponível, uma estimativa cautelosa é utilizada.
Se o erro persistir, tente um novo thread com uma pergunta curta e um pequeno documento. Para uma solicitação realmente grande, reduza os dados de entrada ou escolha um modelo com uma janela maior. Se o erro ocorrer imediatamente em um novo thread, informe ao administrador o horário, a versão do servidor, o modelo escolhido, o modo e o identificador do thread. O administrador verifica a disponibilidade do tokenizador e o tamanho real da solicitação, incluindo as ferramentas.
O campo "Comprimento do contexto (tokens)" deve corresponder às capacidades da instância do modelo em funcionamento. Aumentar esse campo por si só não expande a janela do mecanismo.
.png)
.png)
.png)

.png)
.png)
.png)
.png)
.png)