|
Download README.md from fhswf/tiny-stack-tokenizer: direct link, hf CLI and curl.
- Browser
- Download file 492 Bytes
-
https://huggingface.co/fhswf/tiny-stack-tokenizer/resolve/main/README.md
- Command line
-
hf download hf://fhswf/tiny-stack-tokenizer/README.md
-
curl -L -o README.md https://huggingface.co/fhswf/tiny-stack-tokenizer/resolve/main/README.md
492 Bytes
TinyStack Tokenizer
ByteLevel BPE tokenizer trained on fhswf/tiny-stack dataset.
Usage
from tokenizers.implementations import ByteLevelBPETokenizer
from tokenizers.processors import BertProcessing
tokenizer = ByteLevelBPETokenizer("./vocab.json", "./merges.txt")
tokenizer._tokenizer.post_processor = BertProcessing(
("</s>", tokenizer.token_to_id("</s>")),
("<s>", tokenizer.token_to_id("<s>")),
)
tokenizer.enable_truncation(max_length=512)
Vocab size: 52000