/** * i18n word tokenizer for the L1 lexical index. Uses Intl.Segmenter * (standard ECMAScript — hub-portable) to dictionary-segment Thai/Lao/Khmer/CJK, * which the word-run `tokenize` cannot. Terms are matched in NFKC-lowercased form; * offsets index the ORIGINAL text so snippets slice the user's text. */ import type { Tokenizer } from './tokenize.js'; export interface Token { readonly term: string; readonly offset: number; } /** Word-like tokens with NFKC-lowercased terms + original-text char offsets. */ export declare const segmentTokens: (text: string) => Token[]; /** Term-only tokenizer (the public `Tokenizer` shape) — for queries. */ export declare const segmentTokenizer: Tokenizer;