/** * Unicode Hygiene — remove caracteres invisíveis/homóglifos que modelos de * linguagem às vezes inserem no meio de código gerado (zero-width space no * meio de um identificador, non-breaking space no lugar de espaço normal * quebrando indentação sensível). Determinístico, sem chamada de rede/LLM — * uma passada de regex sobre a string, custo desprezível mesmo em arquivos * grandes. * * Escopo deliberadamente limitado: isto NÃO tenta reverter watermarking * estatístico (padrões de amostragem de token tipo SynthID/Kirchenbauer). * Fazer isso de verdade exigiria ou modelos de ML pesados (dependência * gigante, contra a filosofia zero-dep do framework) ou reescrever o texto * via outra chamada de LLM (custo de token real, e efeito colateral de * remover um sinal de proveniência que existe por razão legítima de * confiança/segurança — não é o mesmo problema que "esse espaço invisível * quebrou meu código"). Ver CHANGELOG para a decisão completa. */ export interface SanitizeResult { text: string; /** Quantos caracteres invisíveis foram removidos. */ removed: number; /** Quantos espaços homóglifos foram normalizados para espaço comum. */ normalizedSpaces: number; /** Verdadeiro se algo mudou (útil pra log/telemetria sem comparar strings de novo). */ changed: boolean; } /** * Remove caracteres de controle invisíveis e normaliza espaços homóglifos. * Sempre determinístico e local — nenhuma chamada de rede/LLM. */ export declare function sanitizeText(input: string): SanitizeResult; //# sourceMappingURL=unicode-hygiene.d.ts.map