2 writes to SpecialTokensRegex
Microsoft.ML.Tokenizers (2)
Model\SentencePieceBaseModel.cs (2)
51
SpecialTokensRegex
= new Regex(string.Join("|", specialTokens.Keys.Select(s => Regex.Escape(s))), RegexOptions.Compiled);
97
SpecialTokensRegex
= new Regex(string.Join("|", specialTokens.Keys.Select(s => Regex.Escape(s))), RegexOptions.Compiled);
24 references to SpecialTokensRegex
Microsoft.ML.Tokenizers (24)
Model\SentencePieceBpeModel.cs (12)
93
if (
SpecialTokensRegex
is not null)
107
Debug.Assert(
SpecialTokensRegex
is not null);
116
foreach ((int Offset, int Length) in PreTokenizer.SplitText(text,
SpecialTokensRegex
!))
345
if (
SpecialTokensRegex
is not null)
359
Debug.Assert(
SpecialTokensRegex
is not null);
375
foreach ((int Offset, int Length) in PreTokenizer.SplitText(text,
SpecialTokensRegex
!))
630
return
SpecialTokensRegex
is not null ?
637
Debug.Assert(
SpecialTokensRegex
is not null);
652
foreach ((int Offset, int Length) in PreTokenizer.SplitText(text,
SpecialTokensRegex
!))
881
if (
SpecialTokensRegex
is not null)
895
Debug.Assert(
SpecialTokensRegex
is not null);
907
(int Offset, int Length)[] splits = PreTokenizer.SplitText(text,
SpecialTokensRegex
!).ToArray();
Model\SentencePieceUnigramModel.cs (12)
392
if (
SpecialTokensRegex
is not null)
492
Debug.Assert(
SpecialTokensRegex
is not null);
503
foreach ((int Offset, int Length) in PreTokenizer.SplitText(text,
SpecialTokensRegex
!))
867
if (
SpecialTokensRegex
is not null)
928
Debug.Assert(
SpecialTokensRegex
is not null);
937
foreach ((int Offset, int Length) in PreTokenizer.SplitText(text,
SpecialTokensRegex
!))
1267
if (
SpecialTokensRegex
is not null)
1309
Debug.Assert(
SpecialTokensRegex
is not null);
1318
foreach ((int Offset, int Length) in PreTokenizer.SplitText(text,
SpecialTokensRegex
!))
1546
if (
SpecialTokensRegex
is not null)
1583
Debug.Assert(
SpecialTokensRegex
is not null);
1589
(int Offset, int Length)[] splits = PreTokenizer.SplitText(text,
SpecialTokensRegex
!).ToArray();