Release v4928.1.4.2 stable
This commit is contained in:
35
RELEASE_v4926_3.md
Normal file
35
RELEASE_v4926_3.md
Normal file
@@ -0,0 +1,35 @@
|
||||
# v4926.3 — Email identity model config and cleanup
|
||||
|
||||
## Objetivo
|
||||
Melhorar a extração de identidade de emails antes do enriquecimento fiscal, com modelo LLM dedicado e limpeza determinística final.
|
||||
|
||||
## Alterações
|
||||
- Novo `EMAIL_IDENTITY_LLM_MODEL` separado de `OPENROUTER_MODEL`.
|
||||
- `scripts/batch_validate_email_identity.py` aceita `--model` para comparar modelos sem alterar `.env`.
|
||||
- O batch mostra o modelo usado no cabeçalho.
|
||||
- Sanitização de `person_name`:
|
||||
- remove artefactos Unicode/CJK como `Luis Roch游戏副本a`;
|
||||
- rejeita rodapés tipo `Enviado do meu Galaxy`.
|
||||
- Sanitização de `company_mentions`:
|
||||
- remove frases longas de avisos legais/GDPR;
|
||||
- extrai nomes curtos como `SOPAC, S.A` e `Imoprates, Lda`;
|
||||
- rejeita mentions com palavras de ruído legal.
|
||||
- `confidence` fica limitada quando não há empresa extraída, para não parecer evidência fiscal forte.
|
||||
- O resultado guarda `llm_model` no payload quando usa LLM.
|
||||
|
||||
## Uso recomendado
|
||||
```bash
|
||||
EMAIL_IDENTITY_LLM_MODEL="anthropic/claude-sonnet-4"
|
||||
```
|
||||
|
||||
Ou teste isolado:
|
||||
```bash
|
||||
PYTHONPATH=. python scripts/batch_validate_email_identity.py \
|
||||
--limit 20 \
|
||||
--use-llm \
|
||||
--timeout-seconds 30 \
|
||||
--model "anthropic/claude-sonnet-4"
|
||||
```
|
||||
|
||||
## Nota operacional
|
||||
A extração continua a ser evidência para revisão/enriquecimento. Não deve auto-aplicar cliente fiscal sozinha.
|
||||
Reference in New Issue
Block a user