Hindi
Marathi
English
tokenizers
tokenizer
bpe
hinglish
minglish
code-mixed
indic
nlp
research-paper
akshar-32k / tokenizer_config.json
Sujalvc's picture
Initial release of Akshar: The High-Efficiency Desi Tokenizer
0c87312 verified
Raw
History Blame Contribute Delete
1.01 kB
{
"model_type": "bpe",
"tokenizer_class": "PreTrainedTokenizerFast",
"bos_token": "<s>",
"eos_token": "</s>",
"unk_token": "<unk>",
"pad_token": "<pad>",
"clean_up_tokenization_spaces": true,
"added_tokens_decoder": {
"0": { "content": "<pad>", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true },
"1": { "content": "<unk>", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true },
"2": { "content": "<s>", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true },
"3": { "content": "</s>", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true },
"4": { "content": "<|user|>", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true },
"5": { "content": "<|assistant|>", "lstrip": false, "normalized": false, "rstrip": false, "single_word": false, "special": true }
}
}