Release v4928.1.4.2 stable

This commit is contained in:
2026-06-09 22:55:58 +01:00
commit 6445044ac6
280 changed files with 41775 additions and 0 deletions

35
RELEASE_v4926_3.md Normal file
View File

@@ -0,0 +1,35 @@
# v4926.3 — Email identity model config and cleanup
## Objetivo
Melhorar a extração de identidade de emails antes do enriquecimento fiscal, com modelo LLM dedicado e limpeza determinística final.
## Alterações
- Novo `EMAIL_IDENTITY_LLM_MODEL` separado de `OPENROUTER_MODEL`.
- `scripts/batch_validate_email_identity.py` aceita `--model` para comparar modelos sem alterar `.env`.
- O batch mostra o modelo usado no cabeçalho.
- Sanitização de `person_name`:
- remove artefactos Unicode/CJK como `Luis Roch游戏副本a`;
- rejeita rodapés tipo `Enviado do meu Galaxy`.
- Sanitização de `company_mentions`:
- remove frases longas de avisos legais/GDPR;
- extrai nomes curtos como `SOPAC, S.A` e `Imoprates, Lda`;
- rejeita mentions com palavras de ruído legal.
- `confidence` fica limitada quando não há empresa extraída, para não parecer evidência fiscal forte.
- O resultado guarda `llm_model` no payload quando usa LLM.
## Uso recomendado
```bash
EMAIL_IDENTITY_LLM_MODEL="anthropic/claude-sonnet-4"
```
Ou teste isolado:
```bash
PYTHONPATH=. python scripts/batch_validate_email_identity.py \
--limit 20 \
--use-llm \
--timeout-seconds 30 \
--model "anthropic/claude-sonnet-4"
```
## Nota operacional
A extração continua a ser evidência para revisão/enriquecimento. Não deve auto-aplicar cliente fiscal sozinha.