Edit on GitHub

sqlglot.tokens

  1from __future__ import annotations
  2
  3import typing as t
  4
  5from sqlglot import tokenizer_core
  6from sqlglot.trie import new_trie
  7
  8from sqlglot.tokenizer_core import Token, TokenizerCore, TokenType
  9
 10
 11# The sqlglotc distribution ships no importable `sqlglotc` module; it overlays
 12# compiled .so files onto sqlglot's modules, so detect it via the compiled core.
 13SQLGLOTC_INSTALLED = not getattr(tokenizer_core, "__file__", "py").endswith(".py")
 14
 15try:
 16    import sqlglotrs  # type: ignore # noqa: F401
 17
 18    if not SQLGLOTC_INSTALLED:
 19        import warnings
 20
 21        warnings.warn(
 22            "sqlglot[rs] is deprecated and no longer compatible with sqlglot. "
 23            "Please use sqlglotc instead for faster parsing: pip install sqlglot[c]",
 24        )
 25except ImportError:
 26    pass
 27
 28if t.TYPE_CHECKING:
 29    from sqlglot.dialects.dialect import DialectType
 30
 31
 32def _convert_quotes(arr: list[str | tuple[str, str]]) -> dict[str, str]:
 33    return dict((item, item) if isinstance(item, str) else (item[0], item[1]) for item in arr)
 34
 35
 36def _quotes_to_format(
 37    token_type: TokenType, arr: list[str | tuple[str, str]]
 38) -> dict[str, tuple[str, TokenType]]:
 39    return {k: (v, token_type) for k, v in _convert_quotes(arr).items()}
 40
 41
 42class _TokenizerBase:
 43    QUOTES: t.ClassVar[list[tuple[str, str] | str]]
 44    IDENTIFIERS: t.ClassVar[list[str | tuple[str, str]]]
 45    BIT_STRINGS: t.ClassVar[list[str | tuple[str, str]]]
 46    BYTE_STRINGS: t.ClassVar[list[str | tuple[str, str]]]
 47    HEX_STRINGS: t.ClassVar[list[str | tuple[str, str]]]
 48    RAW_STRINGS: t.ClassVar[list[str | tuple[str, str]]]
 49    HEREDOC_STRINGS: t.ClassVar[list[str | tuple[str, str]]]
 50    UNICODE_STRINGS: t.ClassVar[list[str | tuple[str, str]]]
 51    STRING_ESCAPES: t.ClassVar[list[str]]
 52    BYTE_STRING_ESCAPES: t.ClassVar[list[str]]
 53    ESCAPE_FOLLOW_CHARS: t.ClassVar[list[str]]
 54    IDENTIFIER_ESCAPES: t.ClassVar[list[str]]
 55    HINT_START: t.ClassVar[str]
 56    KEYWORDS: t.ClassVar[dict[str, TokenType]]
 57    SINGLE_TOKENS: t.ClassVar[dict[str, TokenType]]
 58    NUMERIC_LITERALS: t.ClassVar[dict[str, str]]
 59    VAR_SINGLE_TOKENS: t.ClassVar[set[str]]
 60    COMMANDS: t.ClassVar[set[TokenType]]
 61    COMMAND_PREFIX_TOKENS: t.ClassVar[set[TokenType]]
 62    HEREDOC_TAG_IS_IDENTIFIER: t.ClassVar[bool]
 63    STRING_ESCAPES_ALLOWED_IN_RAW_STRINGS: t.ClassVar[bool]
 64    NESTED_COMMENTS: t.ClassVar[bool]
 65    TOKENS_PRECEDING_HINT: t.ClassVar[set[TokenType]]
 66    HEREDOC_STRING_ALTERNATIVE: t.ClassVar[TokenType]
 67    COMMENTS: t.ClassVar[list[str | tuple[str, str]]]
 68    _QUOTES: t.ClassVar[dict[str, str]]
 69    _IDENTIFIERS: t.ClassVar[dict[str, str]]
 70    _FORMAT_STRINGS: t.ClassVar[dict[str, tuple[str, TokenType]]]
 71    _STRING_ESCAPES: t.ClassVar[set[str]]
 72    _BYTE_STRING_ESCAPES: t.ClassVar[set[str]]
 73    _ESCAPE_FOLLOW_CHARS: t.ClassVar[set[str]]
 74    _IDENTIFIER_ESCAPES: t.ClassVar[set[str]]
 75    _COMMENTS: t.ClassVar[dict[str, str | None]]
 76    _KEYWORD_TRIE: t.ClassVar[dict[str | int, object]]
 77
 78    @classmethod
 79    def __init_subclass__(cls, **kwargs: t.Any) -> None:
 80        super().__init_subclass__(**kwargs)
 81        cls._QUOTES = _convert_quotes(cls.QUOTES)
 82        cls._IDENTIFIERS = _convert_quotes(cls.IDENTIFIERS)
 83        cls._FORMAT_STRINGS = {
 84            **{
 85                p + s: (e, TokenType.NATIONAL_STRING)
 86                for s, e in cls._QUOTES.items()
 87                for p in ("n", "N")
 88            },
 89            **_quotes_to_format(TokenType.BIT_STRING, cls.BIT_STRINGS),
 90            **_quotes_to_format(TokenType.BYTE_STRING, cls.BYTE_STRINGS),
 91            **_quotes_to_format(TokenType.HEX_STRING, cls.HEX_STRINGS),
 92            **_quotes_to_format(TokenType.RAW_STRING, cls.RAW_STRINGS),
 93            **_quotes_to_format(TokenType.HEREDOC_STRING, cls.HEREDOC_STRINGS),
 94            **_quotes_to_format(TokenType.UNICODE_STRING, cls.UNICODE_STRINGS),
 95        }
 96        if "BYTE_STRING_ESCAPES" not in cls.__dict__:
 97            cls.BYTE_STRING_ESCAPES = cls.STRING_ESCAPES.copy()
 98        cls._STRING_ESCAPES = set(cls.STRING_ESCAPES)
 99        cls._BYTE_STRING_ESCAPES = set(cls.BYTE_STRING_ESCAPES)
100        cls._ESCAPE_FOLLOW_CHARS = set(cls.ESCAPE_FOLLOW_CHARS)
101        cls._IDENTIFIER_ESCAPES = set(cls.IDENTIFIER_ESCAPES)
102        cls._COMMENTS = {
103            **{c: None for c in cls.COMMENTS if isinstance(c, str)},
104            **{c[0]: c[1] for c in cls.COMMENTS if not isinstance(c, str)},
105            "{#": "#}",  # Ensure Jinja comments are tokenized correctly in all dialects
106        }
107        if cls.HINT_START in cls.KEYWORDS:
108            cls._COMMENTS[cls.HINT_START] = "*/"
109        cls._KEYWORD_TRIE = new_trie(
110            key.upper()
111            for key in (
112                *cls.KEYWORDS,
113                *cls._COMMENTS,
114                *cls._QUOTES,
115                *cls._FORMAT_STRINGS,
116            )
117            if " " in key or any(single in key for single in cls.SINGLE_TOKENS)
118        )
119
120
121class Tokenizer(_TokenizerBase):
122    SINGLE_TOKENS = {
123        "(": TokenType.L_PAREN,
124        ")": TokenType.R_PAREN,
125        "[": TokenType.L_BRACKET,
126        "]": TokenType.R_BRACKET,
127        "{": TokenType.L_BRACE,
128        "}": TokenType.R_BRACE,
129        "&": TokenType.AMP,
130        "^": TokenType.CARET,
131        ":": TokenType.COLON,
132        ",": TokenType.COMMA,
133        ".": TokenType.DOT,
134        "-": TokenType.DASH,
135        "=": TokenType.EQ,
136        ">": TokenType.GT,
137        "<": TokenType.LT,
138        "%": TokenType.MOD,
139        "!": TokenType.NOT,
140        "|": TokenType.PIPE,
141        "+": TokenType.PLUS,
142        ";": TokenType.SEMICOLON,
143        "/": TokenType.SLASH,
144        "\\": TokenType.BACKSLASH,
145        "*": TokenType.STAR,
146        "~": TokenType.TILDE,
147        "?": TokenType.PLACEHOLDER,
148        "@": TokenType.PARAMETER,
149        "#": TokenType.HASH,
150        # Used for breaking a var like x'y' but nothing else the token type doesn't matter
151        "'": TokenType.UNKNOWN,
152        "`": TokenType.UNKNOWN,
153        '"': TokenType.UNKNOWN,
154    }
155
156    BIT_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
157    BYTE_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
158    HEX_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
159    RAW_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
160    HEREDOC_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
161    UNICODE_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
162    IDENTIFIERS: t.ClassVar[list[str | tuple[str, str]]] = ['"']
163    QUOTES: t.ClassVar[list[tuple[str, str] | str]] = ["'"]
164    STRING_ESCAPES: t.ClassVar[list[str]] = ["'"]
165    BYTE_STRING_ESCAPES: t.ClassVar[list[str]] = []
166    VAR_SINGLE_TOKENS: t.ClassVar[set[str]] = set()
167    ESCAPE_FOLLOW_CHARS: t.ClassVar[list[str]] = []
168
169    # The strings in this list can always be used as escapes, regardless of the surrounding
170    # identifier delimiters. By default, the closing delimiter is assumed to also act as an
171    # identifier escape, e.g. if we use double-quotes, then they also act as escapes: "x"""
172    IDENTIFIER_ESCAPES: t.ClassVar[list[str]] = []
173
174    # Whether the heredoc tags follow the same lexical rules as unquoted identifiers
175    HEREDOC_TAG_IS_IDENTIFIER = False
176
177    # Token that we'll generate as a fallback if the heredoc prefix doesn't correspond to a heredoc
178    HEREDOC_STRING_ALTERNATIVE = TokenType.VAR
179
180    # Whether string escape characters function as such when placed within raw strings
181    STRING_ESCAPES_ALLOWED_IN_RAW_STRINGS = True
182
183    NESTED_COMMENTS = True
184
185    HINT_START = "/*+"
186
187    TOKENS_PRECEDING_HINT = {TokenType.SELECT, TokenType.INSERT, TokenType.UPDATE, TokenType.DELETE}
188
189    # Autofilled
190    _COMMENTS: t.ClassVar[dict[str, str | None]] = {}
191    _FORMAT_STRINGS: t.ClassVar[dict[str, tuple[str, TokenType]]] = {}
192    _IDENTIFIERS: t.ClassVar[dict[str, str]] = {}
193    _IDENTIFIER_ESCAPES: t.ClassVar[set[str]] = set()
194    _QUOTES: t.ClassVar[dict[str, str]] = {}
195    _STRING_ESCAPES: t.ClassVar[set[str]] = set()
196    _BYTE_STRING_ESCAPES: t.ClassVar[set[str]] = set()
197    _KEYWORD_TRIE: t.ClassVar[dict[str | int, object]] = {}
198    _ESCAPE_FOLLOW_CHARS: t.ClassVar[set[str]] = set()
199
200    KEYWORDS: t.ClassVar[dict[str, TokenType]] = {
201        **{f"{{%{postfix}": TokenType.BLOCK_START for postfix in ("", "+", "-")},
202        **{f"{prefix}%}}": TokenType.BLOCK_END for prefix in ("", "+", "-")},
203        **{f"{{{{{postfix}": TokenType.BLOCK_START for postfix in ("+", "-")},
204        **{f"{prefix}}}}}": TokenType.BLOCK_END for prefix in ("+", "-")},
205        HINT_START: TokenType.HINT,
206        "&<": TokenType.AMP_LT,
207        "&>": TokenType.AMP_GT,
208        "==": TokenType.EQ,
209        "::": TokenType.DCOLON,
210        "?::": TokenType.QDCOLON,
211        "||": TokenType.DPIPE,
212        "|>": TokenType.PIPE_GT,
213        ">=": TokenType.GTE,
214        "<=": TokenType.LTE,
215        "<>": TokenType.NEQ,
216        "!=": TokenType.NEQ,
217        ":=": TokenType.COLON_EQ,
218        "<=>": TokenType.NULLSAFE_EQ,
219        "->": TokenType.ARROW,
220        "->>": TokenType.DARROW,
221        "=>": TokenType.FARROW,
222        "#>": TokenType.HASH_ARROW,
223        "#>>": TokenType.DHASH_ARROW,
224        "<->": TokenType.LR_ARROW,
225        "<<->>": TokenType.LLRR_ARROW,
226        "&&": TokenType.DAMP,
227        "??": TokenType.DQMARK,
228        "~~~": TokenType.GLOB,
229        "~~": TokenType.LIKE,
230        "~~*": TokenType.ILIKE,
231        "~*": TokenType.IRLIKE,
232        "-|-": TokenType.ADJACENT,
233        "ALL": TokenType.ALL,
234        "AND": TokenType.AND,
235        "ANTI": TokenType.ANTI,
236        "ANY": TokenType.ANY,
237        "ASC": TokenType.ASC,
238        "AS": TokenType.ALIAS,
239        "ASOF": TokenType.ASOF,
240        "AUTOINCREMENT": TokenType.AUTO_INCREMENT,
241        "AUTO_INCREMENT": TokenType.AUTO_INCREMENT,
242        "BEGIN": TokenType.BEGIN,
243        "BETWEEN": TokenType.BETWEEN,
244        "CACHE": TokenType.CACHE,
245        "UNCACHE": TokenType.UNCACHE,
246        "CASE": TokenType.CASE,
247        "CLUSTER BY": TokenType.CLUSTER_BY,
248        "COLLATE": TokenType.COLLATE,
249        "COLUMN": TokenType.COLUMN,
250        "COMMIT": TokenType.COMMIT,
251        "CONNECT BY": TokenType.CONNECT_BY,
252        "CONSTRAINT": TokenType.CONSTRAINT,
253        "COPY": TokenType.COPY,
254        "CREATE": TokenType.CREATE,
255        "CROSS": TokenType.CROSS,
256        "CUBE": TokenType.CUBE,
257        "CURRENT_DATE": TokenType.CURRENT_DATE,
258        "CURRENT_SCHEMA": TokenType.CURRENT_SCHEMA,
259        "CURRENT_TIME": TokenType.CURRENT_TIME,
260        "CURRENT_TIMESTAMP": TokenType.CURRENT_TIMESTAMP,
261        "CURRENT_USER": TokenType.CURRENT_USER,
262        "CURRENT_CATALOG": TokenType.CURRENT_CATALOG,
263        "DATABASE": TokenType.DATABASE,
264        "DEFAULT": TokenType.DEFAULT,
265        "DELETE": TokenType.DELETE,
266        "DESC": TokenType.DESC,
267        "DESCRIBE": TokenType.DESCRIBE,
268        "DISTINCT": TokenType.DISTINCT,
269        "DISTRIBUTE BY": TokenType.DISTRIBUTE_BY,
270        "DIV": TokenType.DIV,
271        "DROP": TokenType.DROP,
272        "ELSE": TokenType.ELSE,
273        "END": TokenType.END,
274        "ENUM": TokenType.ENUM,
275        "ESCAPE": TokenType.ESCAPE,
276        "EXCEPT": TokenType.EXCEPT,
277        "EXECUTE": TokenType.EXECUTE,
278        "EXISTS": TokenType.EXISTS,
279        "FALSE": TokenType.FALSE,
280        "FETCH": TokenType.FETCH,
281        "FILTER": TokenType.FILTER,
282        "FILE": TokenType.FILE,
283        "FIRST": TokenType.FIRST,
284        "FULL": TokenType.FULL,
285        "FUNCTION": TokenType.FUNCTION,
286        "FOR": TokenType.FOR,
287        "FOREIGN KEY": TokenType.FOREIGN_KEY,
288        "FORMAT": TokenType.FORMAT,
289        "FROM": TokenType.FROM,
290        "GEOGRAPHY": TokenType.GEOGRAPHY,
291        "GEOMETRY": TokenType.GEOMETRY,
292        "GLOB": TokenType.GLOB,
293        "GROUP BY": TokenType.GROUP_BY,
294        "GROUPING SETS": TokenType.GROUPING_SETS,
295        "HAVING": TokenType.HAVING,
296        "ILIKE": TokenType.ILIKE,
297        "IN": TokenType.IN,
298        "INDEX": TokenType.INDEX,
299        "INET": TokenType.INET,
300        "INNER": TokenType.INNER,
301        "INSERT": TokenType.INSERT,
302        "INTERVAL": TokenType.INTERVAL,
303        "INTERSECT": TokenType.INTERSECT,
304        "INTO": TokenType.INTO,
305        "IS": TokenType.IS,
306        "ISNULL": TokenType.ISNULL,
307        "JOIN": TokenType.JOIN,
308        "KEEP": TokenType.KEEP,
309        "KILL": TokenType.KILL,
310        "LATERAL": TokenType.LATERAL,
311        "LEFT": TokenType.LEFT,
312        "LIKE": TokenType.LIKE,
313        "LIMIT": TokenType.LIMIT,
314        "LOAD": TokenType.LOAD,
315        "LOCALTIME": TokenType.LOCALTIME,
316        "LOCALTIMESTAMP": TokenType.LOCALTIMESTAMP,
317        "LOCK": TokenType.LOCK,
318        "MERGE": TokenType.MERGE,
319        "NAMESPACE": TokenType.NAMESPACE,
320        "NATURAL": TokenType.NATURAL,
321        "NEXT": TokenType.NEXT,
322        "NOT": TokenType.NOT,
323        "NOTNULL": TokenType.NOTNULL,
324        "NULL": TokenType.NULL,
325        "OBJECT": TokenType.OBJECT,
326        "OFFSET": TokenType.OFFSET,
327        "ON": TokenType.ON,
328        "OR": TokenType.OR,
329        "XOR": TokenType.XOR,
330        "ORDER BY": TokenType.ORDER_BY,
331        "ORDINALITY": TokenType.ORDINALITY,
332        "OUT": TokenType.OUT,
333        "OUTER": TokenType.OUTER,
334        "OVER": TokenType.OVER,
335        "OVERLAPS": TokenType.OVERLAPS,
336        "OVERWRITE": TokenType.OVERWRITE,
337        "PARTITION": TokenType.PARTITION,
338        "PARTITION BY": TokenType.PARTITION_BY,
339        "PARTITIONED BY": TokenType.PARTITION_BY,
340        "PARTITIONED_BY": TokenType.PARTITION_BY,
341        "PERCENT": TokenType.PERCENT,
342        "PIVOT": TokenType.PIVOT,
343        "PRAGMA": TokenType.PRAGMA,
344        "PRIMARY KEY": TokenType.PRIMARY_KEY,
345        "PROCEDURE": TokenType.PROCEDURE,
346        "OPERATOR": TokenType.OPERATOR,
347        "QUALIFY": TokenType.QUALIFY,
348        "RANGE": TokenType.RANGE,
349        "RECURSIVE": TokenType.RECURSIVE,
350        "REGEXP": TokenType.RLIKE,
351        "RENAME": TokenType.RENAME,
352        "REPLACE": TokenType.REPLACE,
353        "RETURNING": TokenType.RETURNING,
354        "REFERENCES": TokenType.REFERENCES,
355        "RIGHT": TokenType.RIGHT,
356        "RLIKE": TokenType.RLIKE,
357        "ROLLBACK": TokenType.ROLLBACK,
358        "ROLLUP": TokenType.ROLLUP,
359        "ROW": TokenType.ROW,
360        "ROWS": TokenType.ROWS,
361        "SCHEMA": TokenType.SCHEMA,
362        "SELECT": TokenType.SELECT,
363        "SEMI": TokenType.SEMI,
364        "SESSION": TokenType.SESSION,
365        "SESSION_USER": TokenType.SESSION_USER,
366        "SET": TokenType.SET,
367        "SETTINGS": TokenType.SETTINGS,
368        "SHOW": TokenType.SHOW,
369        "SIMILAR TO": TokenType.SIMILAR_TO,
370        "SOME": TokenType.SOME,
371        "SORT BY": TokenType.SORT_BY,
372        "SQL SECURITY": TokenType.SQL_SECURITY,
373        "STRAIGHT_JOIN": TokenType.STRAIGHT_JOIN,
374        "TABLE": TokenType.TABLE,
375        "TABLESAMPLE": TokenType.TABLE_SAMPLE,
376        "TEMP": TokenType.TEMPORARY,
377        "TEMPORARY": TokenType.TEMPORARY,
378        "THEN": TokenType.THEN,
379        "TRUE": TokenType.TRUE,
380        "TRUNCATE": TokenType.TRUNCATE,
381        "TRIGGER": TokenType.TRIGGER,
382        "UNION": TokenType.UNION,
383        "UNKNOWN": TokenType.UNKNOWN,
384        "UNNEST": TokenType.UNNEST,
385        "UNPIVOT": TokenType.UNPIVOT,
386        "UPDATE": TokenType.UPDATE,
387        "USE": TokenType.USE,
388        "USING": TokenType.USING,
389        "UUID": TokenType.UUID,
390        "VALUES": TokenType.VALUES,
391        "VIEW": TokenType.VIEW,
392        "VOLATILE": TokenType.VOLATILE,
393        "WHEN": TokenType.WHEN,
394        "WHERE": TokenType.WHERE,
395        "WINDOW": TokenType.WINDOW,
396        "WITH": TokenType.WITH,
397        "APPLY": TokenType.APPLY,
398        "ARRAY": TokenType.ARRAY,
399        "BIT": TokenType.BIT,
400        "BOOL": TokenType.BOOLEAN,
401        "BOOLEAN": TokenType.BOOLEAN,
402        "BYTE": TokenType.TINYINT,
403        "MEDIUMINT": TokenType.MEDIUMINT,
404        "INT1": TokenType.TINYINT,
405        "TINYINT": TokenType.TINYINT,
406        "INT16": TokenType.SMALLINT,
407        "SHORT": TokenType.SMALLINT,
408        "SMALLINT": TokenType.SMALLINT,
409        "HUGEINT": TokenType.INT128,
410        "UHUGEINT": TokenType.UINT128,
411        "INT2": TokenType.SMALLINT,
412        "INTEGER": TokenType.INT,
413        "INT": TokenType.INT,
414        "INT4": TokenType.INT,
415        "INT32": TokenType.INT,
416        "INT64": TokenType.BIGINT,
417        "INT128": TokenType.INT128,
418        "INT256": TokenType.INT256,
419        "LONG": TokenType.BIGINT,
420        "BIGINT": TokenType.BIGINT,
421        "INT8": TokenType.TINYINT,
422        "UINT": TokenType.UINT,
423        "UINT128": TokenType.UINT128,
424        "UINT256": TokenType.UINT256,
425        "DEC": TokenType.DECIMAL,
426        "DECIMAL": TokenType.DECIMAL,
427        "DECIMAL32": TokenType.DECIMAL32,
428        "DECIMAL64": TokenType.DECIMAL64,
429        "DECIMAL128": TokenType.DECIMAL128,
430        "DECIMAL256": TokenType.DECIMAL256,
431        "DECFLOAT": TokenType.DECFLOAT,
432        "BIGDECIMAL": TokenType.BIGDECIMAL,
433        "BIGNUMERIC": TokenType.BIGDECIMAL,
434        "BIGNUM": TokenType.BIGNUM,
435        "LIST": TokenType.LIST,
436        "MAP": TokenType.MAP,
437        "NULLABLE": TokenType.NULLABLE,
438        "NUMBER": TokenType.DECIMAL,
439        "NUMERIC": TokenType.DECIMAL,
440        "FIXED": TokenType.DECIMAL,
441        "REAL": TokenType.FLOAT,
442        "FLOAT": TokenType.FLOAT,
443        "FLOAT4": TokenType.FLOAT,
444        "FLOAT8": TokenType.DOUBLE,
445        "DOUBLE": TokenType.DOUBLE,
446        "DOUBLE PRECISION": TokenType.DOUBLE,
447        "JSON": TokenType.JSON,
448        "JSONB": TokenType.JSONB,
449        "CHAR": TokenType.CHAR,
450        "CHARACTER": TokenType.CHAR,
451        "CHAR VARYING": TokenType.VARCHAR,
452        "CHARACTER VARYING": TokenType.VARCHAR,
453        "NCHAR": TokenType.NCHAR,
454        "VARCHAR": TokenType.VARCHAR,
455        "VARCHAR2": TokenType.VARCHAR,
456        "NVARCHAR": TokenType.NVARCHAR,
457        "NVARCHAR2": TokenType.NVARCHAR,
458        "BPCHAR": TokenType.BPCHAR,
459        "STR": TokenType.TEXT,
460        "STRING": TokenType.TEXT,
461        "TEXT": TokenType.TEXT,
462        "LONGTEXT": TokenType.LONGTEXT,
463        "MEDIUMTEXT": TokenType.MEDIUMTEXT,
464        "TINYTEXT": TokenType.TINYTEXT,
465        "CLOB": TokenType.TEXT,
466        "LONGVARCHAR": TokenType.TEXT,
467        "BINARY": TokenType.BINARY,
468        "BLOB": TokenType.VARBINARY,
469        "LONGBLOB": TokenType.LONGBLOB,
470        "MEDIUMBLOB": TokenType.MEDIUMBLOB,
471        "TINYBLOB": TokenType.TINYBLOB,
472        "BYTEA": TokenType.VARBINARY,
473        "VARBINARY": TokenType.VARBINARY,
474        "TIME": TokenType.TIME,
475        "TIMETZ": TokenType.TIMETZ,
476        "TIME_NS": TokenType.TIME_NS,
477        "TIMESTAMP": TokenType.TIMESTAMP,
478        "TIMESTAMPTZ": TokenType.TIMESTAMPTZ,
479        "TIMESTAMPLTZ": TokenType.TIMESTAMPLTZ,
480        "TIMESTAMP_LTZ": TokenType.TIMESTAMPLTZ,
481        "TIMESTAMPNTZ": TokenType.TIMESTAMPNTZ,
482        "TIMESTAMP_NTZ": TokenType.TIMESTAMPNTZ,
483        "DATE": TokenType.DATE,
484        "DATETIME": TokenType.DATETIME,
485        "INT4RANGE": TokenType.INT4RANGE,
486        "INT4MULTIRANGE": TokenType.INT4MULTIRANGE,
487        "INT8RANGE": TokenType.INT8RANGE,
488        "INT8MULTIRANGE": TokenType.INT8MULTIRANGE,
489        "NUMRANGE": TokenType.NUMRANGE,
490        "NUMMULTIRANGE": TokenType.NUMMULTIRANGE,
491        "TSRANGE": TokenType.TSRANGE,
492        "TSMULTIRANGE": TokenType.TSMULTIRANGE,
493        "TSTZRANGE": TokenType.TSTZRANGE,
494        "TSTZMULTIRANGE": TokenType.TSTZMULTIRANGE,
495        "DATERANGE": TokenType.DATERANGE,
496        "DATEMULTIRANGE": TokenType.DATEMULTIRANGE,
497        "UNIQUE": TokenType.UNIQUE,
498        "VECTOR": TokenType.VECTOR,
499        "STRUCT": TokenType.STRUCT,
500        "SEQUENCE": TokenType.SEQUENCE,
501        "VARIANT": TokenType.VARIANT,
502        "ALTER": TokenType.ALTER,
503        "ANALYZE": TokenType.ANALYZE,
504        "CALL": TokenType.COMMAND,
505        "COMMENT": TokenType.COMMENT,
506        "EXPLAIN": TokenType.COMMAND,
507        "GRANT": TokenType.GRANT,
508        "REVOKE": TokenType.REVOKE,
509        "OPTIMIZE": TokenType.COMMAND,
510        "PREPARE": TokenType.COMMAND,
511        "VACUUM": TokenType.COMMAND,
512        "USER-DEFINED": TokenType.USERDEFINED,
513    }
514
515    COMMANDS = {
516        TokenType.COMMAND,
517        TokenType.EXECUTE,
518        TokenType.FETCH,
519        TokenType.SHOW,
520        TokenType.RENAME,
521    }
522
523    COMMAND_PREFIX_TOKENS = {TokenType.SEMICOLON, TokenType.BEGIN}
524
525    # Handle numeric literals like in hive (3L = BIGINT)
526    NUMERIC_LITERALS: t.ClassVar[dict[str, str]] = {}
527
528    # In tokenizers like JSONPath, dots are always key separators, never decimal points
529    NUMBERS_CAN_HAVE_DECIMALS: t.ClassVar[bool] = True
530
531    COMMENTS = ["--", ("/*", "*/")]
532
533    __slots__ = (
534        "dialect",
535        "_core",
536    )
537
538    def __init__(self, dialect: DialectType = None) -> None:
539        from sqlglot.dialects.dialect import Dialect
540
541        self.dialect = Dialect.get_or_raise(dialect)
542        self._core = self._init_core()
543
544    def _init_core(self) -> TokenizerCore:
545        return TokenizerCore(
546            single_tokens=self.SINGLE_TOKENS,
547            keywords=self.KEYWORDS,
548            quotes=self._QUOTES,
549            format_strings=self._FORMAT_STRINGS,
550            identifiers=self._IDENTIFIERS,
551            comments=self._COMMENTS,
552            string_escapes=self._STRING_ESCAPES,
553            byte_string_escapes=self._BYTE_STRING_ESCAPES,
554            identifier_escapes=self._IDENTIFIER_ESCAPES,
555            escape_follow_chars=self._ESCAPE_FOLLOW_CHARS,
556            commands=self.COMMANDS,
557            command_prefix_tokens=self.COMMAND_PREFIX_TOKENS,
558            nested_comments=self.NESTED_COMMENTS,
559            hint_start=self.HINT_START,
560            tokens_preceding_hint=self.TOKENS_PRECEDING_HINT,
561            has_bit_strings=bool(self.BIT_STRINGS),
562            has_hex_strings=bool(self.HEX_STRINGS),
563            numeric_literals=self.NUMERIC_LITERALS,
564            var_single_tokens=self.VAR_SINGLE_TOKENS,
565            string_escapes_allowed_in_raw_strings=self.STRING_ESCAPES_ALLOWED_IN_RAW_STRINGS,
566            heredoc_tag_is_identifier=self.HEREDOC_TAG_IS_IDENTIFIER,
567            heredoc_string_alternative=self.HEREDOC_STRING_ALTERNATIVE,
568            keyword_trie=self._KEYWORD_TRIE,
569            numbers_can_be_underscore_separated=self.dialect.NUMBERS_CAN_BE_UNDERSCORE_SEPARATED,
570            numbers_can_have_decimals=self.NUMBERS_CAN_HAVE_DECIMALS,
571            identifiers_can_start_with_digit=self.dialect.IDENTIFIERS_CAN_START_WITH_DIGIT,
572            unescaped_sequences=self.dialect.UNESCAPED_SEQUENCES,
573        )
574
575    def tokenize(self, sql: str) -> list[Token]:
576        """Returns a list of tokens corresponding to the SQL string `sql`."""
577        return self._core.tokenize(sql)  # type: ignore
578
579    @property
580    def sql(self) -> str:
581        """The SQL string being tokenized."""
582        return self._core.sql
583
584    @property
585    def size(self) -> int:
586        """Length of the SQL string."""
587        return self._core.size
588
589    @property
590    def tokens(self) -> list[Token]:
591        """The list of tokens produced by tokenization."""
592        return self._core.tokens
SQLGLOTC_INSTALLED = False
class Tokenizer(_TokenizerBase):
122class Tokenizer(_TokenizerBase):
123    SINGLE_TOKENS = {
124        "(": TokenType.L_PAREN,
125        ")": TokenType.R_PAREN,
126        "[": TokenType.L_BRACKET,
127        "]": TokenType.R_BRACKET,
128        "{": TokenType.L_BRACE,
129        "}": TokenType.R_BRACE,
130        "&": TokenType.AMP,
131        "^": TokenType.CARET,
132        ":": TokenType.COLON,
133        ",": TokenType.COMMA,
134        ".": TokenType.DOT,
135        "-": TokenType.DASH,
136        "=": TokenType.EQ,
137        ">": TokenType.GT,
138        "<": TokenType.LT,
139        "%": TokenType.MOD,
140        "!": TokenType.NOT,
141        "|": TokenType.PIPE,
142        "+": TokenType.PLUS,
143        ";": TokenType.SEMICOLON,
144        "/": TokenType.SLASH,
145        "\\": TokenType.BACKSLASH,
146        "*": TokenType.STAR,
147        "~": TokenType.TILDE,
148        "?": TokenType.PLACEHOLDER,
149        "@": TokenType.PARAMETER,
150        "#": TokenType.HASH,
151        # Used for breaking a var like x'y' but nothing else the token type doesn't matter
152        "'": TokenType.UNKNOWN,
153        "`": TokenType.UNKNOWN,
154        '"': TokenType.UNKNOWN,
155    }
156
157    BIT_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
158    BYTE_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
159    HEX_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
160    RAW_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
161    HEREDOC_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
162    UNICODE_STRINGS: t.ClassVar[list[str | tuple[str, str]]] = []
163    IDENTIFIERS: t.ClassVar[list[str | tuple[str, str]]] = ['"']
164    QUOTES: t.ClassVar[list[tuple[str, str] | str]] = ["'"]
165    STRING_ESCAPES: t.ClassVar[list[str]] = ["'"]
166    BYTE_STRING_ESCAPES: t.ClassVar[list[str]] = []
167    VAR_SINGLE_TOKENS: t.ClassVar[set[str]] = set()
168    ESCAPE_FOLLOW_CHARS: t.ClassVar[list[str]] = []
169
170    # The strings in this list can always be used as escapes, regardless of the surrounding
171    # identifier delimiters. By default, the closing delimiter is assumed to also act as an
172    # identifier escape, e.g. if we use double-quotes, then they also act as escapes: "x"""
173    IDENTIFIER_ESCAPES: t.ClassVar[list[str]] = []
174
175    # Whether the heredoc tags follow the same lexical rules as unquoted identifiers
176    HEREDOC_TAG_IS_IDENTIFIER = False
177
178    # Token that we'll generate as a fallback if the heredoc prefix doesn't correspond to a heredoc
179    HEREDOC_STRING_ALTERNATIVE = TokenType.VAR
180
181    # Whether string escape characters function as such when placed within raw strings
182    STRING_ESCAPES_ALLOWED_IN_RAW_STRINGS = True
183
184    NESTED_COMMENTS = True
185
186    HINT_START = "/*+"
187
188    TOKENS_PRECEDING_HINT = {TokenType.SELECT, TokenType.INSERT, TokenType.UPDATE, TokenType.DELETE}
189
190    # Autofilled
191    _COMMENTS: t.ClassVar[dict[str, str | None]] = {}
192    _FORMAT_STRINGS: t.ClassVar[dict[str, tuple[str, TokenType]]] = {}
193    _IDENTIFIERS: t.ClassVar[dict[str, str]] = {}
194    _IDENTIFIER_ESCAPES: t.ClassVar[set[str]] = set()
195    _QUOTES: t.ClassVar[dict[str, str]] = {}
196    _STRING_ESCAPES: t.ClassVar[set[str]] = set()
197    _BYTE_STRING_ESCAPES: t.ClassVar[set[str]] = set()
198    _KEYWORD_TRIE: t.ClassVar[dict[str | int, object]] = {}
199    _ESCAPE_FOLLOW_CHARS: t.ClassVar[set[str]] = set()
200
201    KEYWORDS: t.ClassVar[dict[str, TokenType]] = {
202        **{f"{{%{postfix}": TokenType.BLOCK_START for postfix in ("", "+", "-")},
203        **{f"{prefix}%}}": TokenType.BLOCK_END for prefix in ("", "+", "-")},
204        **{f"{{{{{postfix}": TokenType.BLOCK_START for postfix in ("+", "-")},
205        **{f"{prefix}}}}}": TokenType.BLOCK_END for prefix in ("+", "-")},
206        HINT_START: TokenType.HINT,
207        "&<": TokenType.AMP_LT,
208        "&>": TokenType.AMP_GT,
209        "==": TokenType.EQ,
210        "::": TokenType.DCOLON,
211        "?::": TokenType.QDCOLON,
212        "||": TokenType.DPIPE,
213        "|>": TokenType.PIPE_GT,
214        ">=": TokenType.GTE,
215        "<=": TokenType.LTE,
216        "<>": TokenType.NEQ,
217        "!=": TokenType.NEQ,
218        ":=": TokenType.COLON_EQ,
219        "<=>": TokenType.NULLSAFE_EQ,
220        "->": TokenType.ARROW,
221        "->>": TokenType.DARROW,
222        "=>": TokenType.FARROW,
223        "#>": TokenType.HASH_ARROW,
224        "#>>": TokenType.DHASH_ARROW,
225        "<->": TokenType.LR_ARROW,
226        "<<->>": TokenType.LLRR_ARROW,
227        "&&": TokenType.DAMP,
228        "??": TokenType.DQMARK,
229        "~~~": TokenType.GLOB,
230        "~~": TokenType.LIKE,
231        "~~*": TokenType.ILIKE,
232        "~*": TokenType.IRLIKE,
233        "-|-": TokenType.ADJACENT,
234        "ALL": TokenType.ALL,
235        "AND": TokenType.AND,
236        "ANTI": TokenType.ANTI,
237        "ANY": TokenType.ANY,
238        "ASC": TokenType.ASC,
239        "AS": TokenType.ALIAS,
240        "ASOF": TokenType.ASOF,
241        "AUTOINCREMENT": TokenType.AUTO_INCREMENT,
242        "AUTO_INCREMENT": TokenType.AUTO_INCREMENT,
243        "BEGIN": TokenType.BEGIN,
244        "BETWEEN": TokenType.BETWEEN,
245        "CACHE": TokenType.CACHE,
246        "UNCACHE": TokenType.UNCACHE,
247        "CASE": TokenType.CASE,
248        "CLUSTER BY": TokenType.CLUSTER_BY,
249        "COLLATE": TokenType.COLLATE,
250        "COLUMN": TokenType.COLUMN,
251        "COMMIT": TokenType.COMMIT,
252        "CONNECT BY": TokenType.CONNECT_BY,
253        "CONSTRAINT": TokenType.CONSTRAINT,
254        "COPY": TokenType.COPY,
255        "CREATE": TokenType.CREATE,
256        "CROSS": TokenType.CROSS,
257        "CUBE": TokenType.CUBE,
258        "CURRENT_DATE": TokenType.CURRENT_DATE,
259        "CURRENT_SCHEMA": TokenType.CURRENT_SCHEMA,
260        "CURRENT_TIME": TokenType.CURRENT_TIME,
261        "CURRENT_TIMESTAMP": TokenType.CURRENT_TIMESTAMP,
262        "CURRENT_USER": TokenType.CURRENT_USER,
263        "CURRENT_CATALOG": TokenType.CURRENT_CATALOG,
264        "DATABASE": TokenType.DATABASE,
265        "DEFAULT": TokenType.DEFAULT,
266        "DELETE": TokenType.DELETE,
267        "DESC": TokenType.DESC,
268        "DESCRIBE": TokenType.DESCRIBE,
269        "DISTINCT": TokenType.DISTINCT,
270        "DISTRIBUTE BY": TokenType.DISTRIBUTE_BY,
271        "DIV": TokenType.DIV,
272        "DROP": TokenType.DROP,
273        "ELSE": TokenType.ELSE,
274        "END": TokenType.END,
275        "ENUM": TokenType.ENUM,
276        "ESCAPE": TokenType.ESCAPE,
277        "EXCEPT": TokenType.EXCEPT,
278        "EXECUTE": TokenType.EXECUTE,
279        "EXISTS": TokenType.EXISTS,
280        "FALSE": TokenType.FALSE,
281        "FETCH": TokenType.FETCH,
282        "FILTER": TokenType.FILTER,
283        "FILE": TokenType.FILE,
284        "FIRST": TokenType.FIRST,
285        "FULL": TokenType.FULL,
286        "FUNCTION": TokenType.FUNCTION,
287        "FOR": TokenType.FOR,
288        "FOREIGN KEY": TokenType.FOREIGN_KEY,
289        "FORMAT": TokenType.FORMAT,
290        "FROM": TokenType.FROM,
291        "GEOGRAPHY": TokenType.GEOGRAPHY,
292        "GEOMETRY": TokenType.GEOMETRY,
293        "GLOB": TokenType.GLOB,
294        "GROUP BY": TokenType.GROUP_BY,
295        "GROUPING SETS": TokenType.GROUPING_SETS,
296        "HAVING": TokenType.HAVING,
297        "ILIKE": TokenType.ILIKE,
298        "IN": TokenType.IN,
299        "INDEX": TokenType.INDEX,
300        "INET": TokenType.INET,
301        "INNER": TokenType.INNER,
302        "INSERT": TokenType.INSERT,
303        "INTERVAL": TokenType.INTERVAL,
304        "INTERSECT": TokenType.INTERSECT,
305        "INTO": TokenType.INTO,
306        "IS": TokenType.IS,
307        "ISNULL": TokenType.ISNULL,
308        "JOIN": TokenType.JOIN,
309        "KEEP": TokenType.KEEP,
310        "KILL": TokenType.KILL,
311        "LATERAL": TokenType.LATERAL,
312        "LEFT": TokenType.LEFT,
313        "LIKE": TokenType.LIKE,
314        "LIMIT": TokenType.LIMIT,
315        "LOAD": TokenType.LOAD,
316        "LOCALTIME": TokenType.LOCALTIME,
317        "LOCALTIMESTAMP": TokenType.LOCALTIMESTAMP,
318        "LOCK": TokenType.LOCK,
319        "MERGE": TokenType.MERGE,
320        "NAMESPACE": TokenType.NAMESPACE,
321        "NATURAL": TokenType.NATURAL,
322        "NEXT": TokenType.NEXT,
323        "NOT": TokenType.NOT,
324        "NOTNULL": TokenType.NOTNULL,
325        "NULL": TokenType.NULL,
326        "OBJECT": TokenType.OBJECT,
327        "OFFSET": TokenType.OFFSET,
328        "ON": TokenType.ON,
329        "OR": TokenType.OR,
330        "XOR": TokenType.XOR,
331        "ORDER BY": TokenType.ORDER_BY,
332        "ORDINALITY": TokenType.ORDINALITY,
333        "OUT": TokenType.OUT,
334        "OUTER": TokenType.OUTER,
335        "OVER": TokenType.OVER,
336        "OVERLAPS": TokenType.OVERLAPS,
337        "OVERWRITE": TokenType.OVERWRITE,
338        "PARTITION": TokenType.PARTITION,
339        "PARTITION BY": TokenType.PARTITION_BY,
340        "PARTITIONED BY": TokenType.PARTITION_BY,
341        "PARTITIONED_BY": TokenType.PARTITION_BY,
342        "PERCENT": TokenType.PERCENT,
343        "PIVOT": TokenType.PIVOT,
344        "PRAGMA": TokenType.PRAGMA,
345        "PRIMARY KEY": TokenType.PRIMARY_KEY,
346        "PROCEDURE": TokenType.PROCEDURE,
347        "OPERATOR": TokenType.OPERATOR,
348        "QUALIFY": TokenType.QUALIFY,
349        "RANGE": TokenType.RANGE,
350        "RECURSIVE": TokenType.RECURSIVE,
351        "REGEXP": TokenType.RLIKE,
352        "RENAME": TokenType.RENAME,
353        "REPLACE": TokenType.REPLACE,
354        "RETURNING": TokenType.RETURNING,
355        "REFERENCES": TokenType.REFERENCES,
356        "RIGHT": TokenType.RIGHT,
357        "RLIKE": TokenType.RLIKE,
358        "ROLLBACK": TokenType.ROLLBACK,
359        "ROLLUP": TokenType.ROLLUP,
360        "ROW": TokenType.ROW,
361        "ROWS": TokenType.ROWS,
362        "SCHEMA": TokenType.SCHEMA,
363        "SELECT": TokenType.SELECT,
364        "SEMI": TokenType.SEMI,
365        "SESSION": TokenType.SESSION,
366        "SESSION_USER": TokenType.SESSION_USER,
367        "SET": TokenType.SET,
368        "SETTINGS": TokenType.SETTINGS,
369        "SHOW": TokenType.SHOW,
370        "SIMILAR TO": TokenType.SIMILAR_TO,
371        "SOME": TokenType.SOME,
372        "SORT BY": TokenType.SORT_BY,
373        "SQL SECURITY": TokenType.SQL_SECURITY,
374        "STRAIGHT_JOIN": TokenType.STRAIGHT_JOIN,
375        "TABLE": TokenType.TABLE,
376        "TABLESAMPLE": TokenType.TABLE_SAMPLE,
377        "TEMP": TokenType.TEMPORARY,
378        "TEMPORARY": TokenType.TEMPORARY,
379        "THEN": TokenType.THEN,
380        "TRUE": TokenType.TRUE,
381        "TRUNCATE": TokenType.TRUNCATE,
382        "TRIGGER": TokenType.TRIGGER,
383        "UNION": TokenType.UNION,
384        "UNKNOWN": TokenType.UNKNOWN,
385        "UNNEST": TokenType.UNNEST,
386        "UNPIVOT": TokenType.UNPIVOT,
387        "UPDATE": TokenType.UPDATE,
388        "USE": TokenType.USE,
389        "USING": TokenType.USING,
390        "UUID": TokenType.UUID,
391        "VALUES": TokenType.VALUES,
392        "VIEW": TokenType.VIEW,
393        "VOLATILE": TokenType.VOLATILE,
394        "WHEN": TokenType.WHEN,
395        "WHERE": TokenType.WHERE,
396        "WINDOW": TokenType.WINDOW,
397        "WITH": TokenType.WITH,
398        "APPLY": TokenType.APPLY,
399        "ARRAY": TokenType.ARRAY,
400        "BIT": TokenType.BIT,
401        "BOOL": TokenType.BOOLEAN,
402        "BOOLEAN": TokenType.BOOLEAN,
403        "BYTE": TokenType.TINYINT,
404        "MEDIUMINT": TokenType.MEDIUMINT,
405        "INT1": TokenType.TINYINT,
406        "TINYINT": TokenType.TINYINT,
407        "INT16": TokenType.SMALLINT,
408        "SHORT": TokenType.SMALLINT,
409        "SMALLINT": TokenType.SMALLINT,
410        "HUGEINT": TokenType.INT128,
411        "UHUGEINT": TokenType.UINT128,
412        "INT2": TokenType.SMALLINT,
413        "INTEGER": TokenType.INT,
414        "INT": TokenType.INT,
415        "INT4": TokenType.INT,
416        "INT32": TokenType.INT,
417        "INT64": TokenType.BIGINT,
418        "INT128": TokenType.INT128,
419        "INT256": TokenType.INT256,
420        "LONG": TokenType.BIGINT,
421        "BIGINT": TokenType.BIGINT,
422        "INT8": TokenType.TINYINT,
423        "UINT": TokenType.UINT,
424        "UINT128": TokenType.UINT128,
425        "UINT256": TokenType.UINT256,
426        "DEC": TokenType.DECIMAL,
427        "DECIMAL": TokenType.DECIMAL,
428        "DECIMAL32": TokenType.DECIMAL32,
429        "DECIMAL64": TokenType.DECIMAL64,
430        "DECIMAL128": TokenType.DECIMAL128,
431        "DECIMAL256": TokenType.DECIMAL256,
432        "DECFLOAT": TokenType.DECFLOAT,
433        "BIGDECIMAL": TokenType.BIGDECIMAL,
434        "BIGNUMERIC": TokenType.BIGDECIMAL,
435        "BIGNUM": TokenType.BIGNUM,
436        "LIST": TokenType.LIST,
437        "MAP": TokenType.MAP,
438        "NULLABLE": TokenType.NULLABLE,
439        "NUMBER": TokenType.DECIMAL,
440        "NUMERIC": TokenType.DECIMAL,
441        "FIXED": TokenType.DECIMAL,
442        "REAL": TokenType.FLOAT,
443        "FLOAT": TokenType.FLOAT,
444        "FLOAT4": TokenType.FLOAT,
445        "FLOAT8": TokenType.DOUBLE,
446        "DOUBLE": TokenType.DOUBLE,
447        "DOUBLE PRECISION": TokenType.DOUBLE,
448        "JSON": TokenType.JSON,
449        "JSONB": TokenType.JSONB,
450        "CHAR": TokenType.CHAR,
451        "CHARACTER": TokenType.CHAR,
452        "CHAR VARYING": TokenType.VARCHAR,
453        "CHARACTER VARYING": TokenType.VARCHAR,
454        "NCHAR": TokenType.NCHAR,
455        "VARCHAR": TokenType.VARCHAR,
456        "VARCHAR2": TokenType.VARCHAR,
457        "NVARCHAR": TokenType.NVARCHAR,
458        "NVARCHAR2": TokenType.NVARCHAR,
459        "BPCHAR": TokenType.BPCHAR,
460        "STR": TokenType.TEXT,
461        "STRING": TokenType.TEXT,
462        "TEXT": TokenType.TEXT,
463        "LONGTEXT": TokenType.LONGTEXT,
464        "MEDIUMTEXT": TokenType.MEDIUMTEXT,
465        "TINYTEXT": TokenType.TINYTEXT,
466        "CLOB": TokenType.TEXT,
467        "LONGVARCHAR": TokenType.TEXT,
468        "BINARY": TokenType.BINARY,
469        "BLOB": TokenType.VARBINARY,
470        "LONGBLOB": TokenType.LONGBLOB,
471        "MEDIUMBLOB": TokenType.MEDIUMBLOB,
472        "TINYBLOB": TokenType.TINYBLOB,
473        "BYTEA": TokenType.VARBINARY,
474        "VARBINARY": TokenType.VARBINARY,
475        "TIME": TokenType.TIME,
476        "TIMETZ": TokenType.TIMETZ,
477        "TIME_NS": TokenType.TIME_NS,
478        "TIMESTAMP": TokenType.TIMESTAMP,
479        "TIMESTAMPTZ": TokenType.TIMESTAMPTZ,
480        "TIMESTAMPLTZ": TokenType.TIMESTAMPLTZ,
481        "TIMESTAMP_LTZ": TokenType.TIMESTAMPLTZ,
482        "TIMESTAMPNTZ": TokenType.TIMESTAMPNTZ,
483        "TIMESTAMP_NTZ": TokenType.TIMESTAMPNTZ,
484        "DATE": TokenType.DATE,
485        "DATETIME": TokenType.DATETIME,
486        "INT4RANGE": TokenType.INT4RANGE,
487        "INT4MULTIRANGE": TokenType.INT4MULTIRANGE,
488        "INT8RANGE": TokenType.INT8RANGE,
489        "INT8MULTIRANGE": TokenType.INT8MULTIRANGE,
490        "NUMRANGE": TokenType.NUMRANGE,
491        "NUMMULTIRANGE": TokenType.NUMMULTIRANGE,
492        "TSRANGE": TokenType.TSRANGE,
493        "TSMULTIRANGE": TokenType.TSMULTIRANGE,
494        "TSTZRANGE": TokenType.TSTZRANGE,
495        "TSTZMULTIRANGE": TokenType.TSTZMULTIRANGE,
496        "DATERANGE": TokenType.DATERANGE,
497        "DATEMULTIRANGE": TokenType.DATEMULTIRANGE,
498        "UNIQUE": TokenType.UNIQUE,
499        "VECTOR": TokenType.VECTOR,
500        "STRUCT": TokenType.STRUCT,
501        "SEQUENCE": TokenType.SEQUENCE,
502        "VARIANT": TokenType.VARIANT,
503        "ALTER": TokenType.ALTER,
504        "ANALYZE": TokenType.ANALYZE,
505        "CALL": TokenType.COMMAND,
506        "COMMENT": TokenType.COMMENT,
507        "EXPLAIN": TokenType.COMMAND,
508        "GRANT": TokenType.GRANT,
509        "REVOKE": TokenType.REVOKE,
510        "OPTIMIZE": TokenType.COMMAND,
511        "PREPARE": TokenType.COMMAND,
512        "VACUUM": TokenType.COMMAND,
513        "USER-DEFINED": TokenType.USERDEFINED,
514    }
515
516    COMMANDS = {
517        TokenType.COMMAND,
518        TokenType.EXECUTE,
519        TokenType.FETCH,
520        TokenType.SHOW,
521        TokenType.RENAME,
522    }
523
524    COMMAND_PREFIX_TOKENS = {TokenType.SEMICOLON, TokenType.BEGIN}
525
526    # Handle numeric literals like in hive (3L = BIGINT)
527    NUMERIC_LITERALS: t.ClassVar[dict[str, str]] = {}
528
529    # In tokenizers like JSONPath, dots are always key separators, never decimal points
530    NUMBERS_CAN_HAVE_DECIMALS: t.ClassVar[bool] = True
531
532    COMMENTS = ["--", ("/*", "*/")]
533
534    __slots__ = (
535        "dialect",
536        "_core",
537    )
538
539    def __init__(self, dialect: DialectType = None) -> None:
540        from sqlglot.dialects.dialect import Dialect
541
542        self.dialect = Dialect.get_or_raise(dialect)
543        self._core = self._init_core()
544
545    def _init_core(self) -> TokenizerCore:
546        return TokenizerCore(
547            single_tokens=self.SINGLE_TOKENS,
548            keywords=self.KEYWORDS,
549            quotes=self._QUOTES,
550            format_strings=self._FORMAT_STRINGS,
551            identifiers=self._IDENTIFIERS,
552            comments=self._COMMENTS,
553            string_escapes=self._STRING_ESCAPES,
554            byte_string_escapes=self._BYTE_STRING_ESCAPES,
555            identifier_escapes=self._IDENTIFIER_ESCAPES,
556            escape_follow_chars=self._ESCAPE_FOLLOW_CHARS,
557            commands=self.COMMANDS,
558            command_prefix_tokens=self.COMMAND_PREFIX_TOKENS,
559            nested_comments=self.NESTED_COMMENTS,
560            hint_start=self.HINT_START,
561            tokens_preceding_hint=self.TOKENS_PRECEDING_HINT,
562            has_bit_strings=bool(self.BIT_STRINGS),
563            has_hex_strings=bool(self.HEX_STRINGS),
564            numeric_literals=self.NUMERIC_LITERALS,
565            var_single_tokens=self.VAR_SINGLE_TOKENS,
566            string_escapes_allowed_in_raw_strings=self.STRING_ESCAPES_ALLOWED_IN_RAW_STRINGS,
567            heredoc_tag_is_identifier=self.HEREDOC_TAG_IS_IDENTIFIER,
568            heredoc_string_alternative=self.HEREDOC_STRING_ALTERNATIVE,
569            keyword_trie=self._KEYWORD_TRIE,
570            numbers_can_be_underscore_separated=self.dialect.NUMBERS_CAN_BE_UNDERSCORE_SEPARATED,
571            numbers_can_have_decimals=self.NUMBERS_CAN_HAVE_DECIMALS,
572            identifiers_can_start_with_digit=self.dialect.IDENTIFIERS_CAN_START_WITH_DIGIT,
573            unescaped_sequences=self.dialect.UNESCAPED_SEQUENCES,
574        )
575
576    def tokenize(self, sql: str) -> list[Token]:
577        """Returns a list of tokens corresponding to the SQL string `sql`."""
578        return self._core.tokenize(sql)  # type: ignore
579
580    @property
581    def sql(self) -> str:
582        """The SQL string being tokenized."""
583        return self._core.sql
584
585    @property
586    def size(self) -> int:
587        """Length of the SQL string."""
588        return self._core.size
589
590    @property
591    def tokens(self) -> list[Token]:
592        """The list of tokens produced by tokenization."""
593        return self._core.tokens
Tokenizer( dialect: Union[str, sqlglot.dialects.Dialect, type[sqlglot.dialects.Dialect], NoneType] = None)
539    def __init__(self, dialect: DialectType = None) -> None:
540        from sqlglot.dialects.dialect import Dialect
541
542        self.dialect = Dialect.get_or_raise(dialect)
543        self._core = self._init_core()
SINGLE_TOKENS = {'(': <TokenType.L_PAREN: 1>, ')': <TokenType.R_PAREN: 2>, '[': <TokenType.L_BRACKET: 3>, ']': <TokenType.R_BRACKET: 4>, '{': <TokenType.L_BRACE: 5>, '}': <TokenType.R_BRACE: 6>, '&': <TokenType.AMP: 36>, '^': <TokenType.CARET: 42>, ':': <TokenType.COLON: 11>, ',': <TokenType.COMMA: 7>, '.': <TokenType.DOT: 8>, '-': <TokenType.DASH: 9>, '=': <TokenType.EQ: 28>, '>': <TokenType.GT: 25>, '<': <TokenType.LT: 23>, '%': <TokenType.MOD: 329>, '!': <TokenType.NOT: 27>, '|': <TokenType.PIPE: 39>, '+': <TokenType.PLUS: 10>, ';': <TokenType.SEMICOLON: 19>, '/': <TokenType.SLASH: 22>, '\\': <TokenType.BACKSLASH: 21>, '*': <TokenType.STAR: 20>, '~': <TokenType.TILDE: 44>, '?': <TokenType.PLACEHOLDER: 356>, '@': <TokenType.PARAMETER: 58>, '#': <TokenType.HASH: 48>, "'": <TokenType.UNKNOWN: 214>, '`': <TokenType.UNKNOWN: 214>, '"': <TokenType.UNKNOWN: 214>}
BIT_STRINGS: ClassVar[list[tuple[str, str] | str]] = []
BYTE_STRINGS: ClassVar[list[tuple[str, str] | str]] = []
HEX_STRINGS: ClassVar[list[tuple[str, str] | str]] = []
RAW_STRINGS: ClassVar[list[tuple[str, str] | str]] = []
HEREDOC_STRINGS: ClassVar[list[tuple[str, str] | str]] = []
UNICODE_STRINGS: ClassVar[list[tuple[str, str] | str]] = []
IDENTIFIERS: ClassVar[list[tuple[str, str] | str]] = ['"']
QUOTES: ClassVar[list[tuple[str, str] | str]] = ["'"]
STRING_ESCAPES: ClassVar[list[str]] = ["'"]
BYTE_STRING_ESCAPES: ClassVar[list[str]] = []
VAR_SINGLE_TOKENS: ClassVar[set[str]] = set()
ESCAPE_FOLLOW_CHARS: ClassVar[list[str]] = []
IDENTIFIER_ESCAPES: ClassVar[list[str]] = []
HEREDOC_TAG_IS_IDENTIFIER = False
HEREDOC_STRING_ALTERNATIVE = <TokenType.VAR: 89>
STRING_ESCAPES_ALLOWED_IN_RAW_STRINGS = True
NESTED_COMMENTS = True
HINT_START = '/*+'
TOKENS_PRECEDING_HINT = {<TokenType.DELETE: 257>, <TokenType.SELECT: 387>, <TokenType.INSERT: 300>, <TokenType.UPDATE: 419>}
KEYWORDS: ClassVar[dict[str, sqlglot.tokenizer_core.TokenType]] = {'{%': <TokenType.BLOCK_START: 73>, '{%+': <TokenType.BLOCK_START: 73>, '{%-': <TokenType.BLOCK_START: 73>, '%}': <TokenType.BLOCK_END: 74>, '+%}': <TokenType.BLOCK_END: 74>, '-%}': <TokenType.BLOCK_END: 74>, '{{+': <TokenType.BLOCK_START: 73>, '{{-': <TokenType.BLOCK_START: 73>, '+}}': <TokenType.BLOCK_END: 74>, '-}}': <TokenType.BLOCK_END: 74>, '/*+': <TokenType.HINT: 293>, '&<': <TokenType.AMP_LT: 63>, '&>': <TokenType.AMP_GT: 64>, '==': <TokenType.EQ: 28>, '::': <TokenType.DCOLON: 14>, '?::': <TokenType.QDCOLON: 370>, '||': <TokenType.DPIPE: 37>, '|>': <TokenType.PIPE_GT: 38>, '>=': <TokenType.GTE: 26>, '<=': <TokenType.LTE: 24>, '<>': <TokenType.NEQ: 29>, '!=': <TokenType.NEQ: 29>, ':=': <TokenType.COLON_EQ: 31>, '<=>': <TokenType.NULLSAFE_EQ: 30>, '->': <TokenType.ARROW: 45>, '->>': <TokenType.DARROW: 46>, '=>': <TokenType.FARROW: 47>, '#>': <TokenType.HASH_ARROW: 49>, '#>>': <TokenType.DHASH_ARROW: 50>, '<->': <TokenType.LR_ARROW: 51>, '<<->>': <TokenType.LLRR_ARROW: 52>, '&&': <TokenType.DAMP: 62>, '??': <TokenType.DQMARK: 18>, '~~~': <TokenType.GLOB: 287>, '~~': <TokenType.LIKE: 318>, '~~*': <TokenType.ILIKE: 295>, '~*': <TokenType.IRLIKE: 307>, '-|-': <TokenType.ADJACENT: 65>, 'ALL': <TokenType.ALL: 220>, 'AND': <TokenType.AND: 34>, 'ANTI': <TokenType.ANTI: 221>, 'ANY': <TokenType.ANY: 222>, 'ASC': <TokenType.ASC: 225>, 'AS': <TokenType.ALIAS: 218>, 'ASOF': <TokenType.ASOF: 226>, 'AUTOINCREMENT': <TokenType.AUTO_INCREMENT: 228>, 'AUTO_INCREMENT': <TokenType.AUTO_INCREMENT: 228>, 'BEGIN': <TokenType.BEGIN: 229>, 'BETWEEN': <TokenType.BETWEEN: 230>, 'CACHE': <TokenType.CACHE: 232>, 'UNCACHE': <TokenType.UNCACHE: 414>, 'CASE': <TokenType.CASE: 233>, 'CLUSTER BY': <TokenType.CLUSTER_BY: 235>, 'COLLATE': <TokenType.COLLATE: 236>, 'COLUMN': <TokenType.COLUMN: 81>, 'COMMIT': <TokenType.COMMIT: 239>, 'CONNECT BY': <TokenType.CONNECT_BY: 240>, 'CONSTRAINT': <TokenType.CONSTRAINT: 241>, 'COPY': <TokenType.COPY: 242>, 'CREATE': <TokenType.CREATE: 243>, 'CROSS': <TokenType.CROSS: 244>, 'CUBE': <TokenType.CUBE: 245>, 'CURRENT_DATE': <TokenType.CURRENT_DATE: 246>, 'CURRENT_SCHEMA': <TokenType.CURRENT_SCHEMA: 248>, 'CURRENT_TIME': <TokenType.CURRENT_TIME: 249>, 'CURRENT_TIMESTAMP': <TokenType.CURRENT_TIMESTAMP: 250>, 'CURRENT_USER': <TokenType.CURRENT_USER: 251>, 'CURRENT_CATALOG': <TokenType.CURRENT_CATALOG: 254>, 'DATABASE': <TokenType.DATABASE: 80>, 'DEFAULT': <TokenType.DEFAULT: 256>, 'DELETE': <TokenType.DELETE: 257>, 'DESC': <TokenType.DESC: 258>, 'DESCRIBE': <TokenType.DESCRIBE: 259>, 'DISTINCT': <TokenType.DISTINCT: 262>, 'DISTRIBUTE BY': <TokenType.DISTRIBUTE_BY: 263>, 'DIV': <TokenType.DIV: 264>, 'DROP': <TokenType.DROP: 265>, 'ELSE': <TokenType.ELSE: 266>, 'END': <TokenType.END: 267>, 'ENUM': <TokenType.ENUM: 205>, 'ESCAPE': <TokenType.ESCAPE: 268>, 'EXCEPT': <TokenType.EXCEPT: 269>, 'EXECUTE': <TokenType.EXECUTE: 270>, 'EXISTS': <TokenType.EXISTS: 271>, 'FALSE': <TokenType.FALSE: 272>, 'FETCH': <TokenType.FETCH: 273>, 'FILTER': <TokenType.FILTER: 276>, 'FILE': <TokenType.FILE: 274>, 'FIRST': <TokenType.FIRST: 278>, 'FULL': <TokenType.FULL: 284>, 'FUNCTION': <TokenType.FUNCTION: 285>, 'FOR': <TokenType.FOR: 279>, 'FOREIGN KEY': <TokenType.FOREIGN_KEY: 281>, 'FORMAT': <TokenType.FORMAT: 282>, 'FROM': <TokenType.FROM: 283>, 'GEOGRAPHY': <TokenType.GEOGRAPHY: 172>, 'GEOMETRY': <TokenType.GEOMETRY: 175>, 'GLOB': <TokenType.GLOB: 287>, 'GROUP BY': <TokenType.GROUP_BY: 290>, 'GROUPING SETS': <TokenType.GROUPING_SETS: 291>, 'HAVING': <TokenType.HAVING: 292>, 'ILIKE': <TokenType.ILIKE: 295>, 'IN': <TokenType.IN: 296>, 'INDEX': <TokenType.INDEX: 297>, 'INET': <TokenType.INET: 200>, 'INNER': <TokenType.INNER: 299>, 'INSERT': <TokenType.INSERT: 300>, 'INTERVAL': <TokenType.INTERVAL: 304>, 'INTERSECT': <TokenType.INTERSECT: 303>, 'INTO': <TokenType.INTO: 305>, 'IS': <TokenType.IS: 308>, 'ISNULL': <TokenType.ISNULL: 309>, 'JOIN': <TokenType.JOIN: 310>, 'KEEP': <TokenType.KEEP: 312>, 'KILL': <TokenType.KILL: 314>, 'LATERAL': <TokenType.LATERAL: 316>, 'LEFT': <TokenType.LEFT: 317>, 'LIKE': <TokenType.LIKE: 318>, 'LIMIT': <TokenType.LIMIT: 319>, 'LOAD': <TokenType.LOAD: 321>, 'LOCALTIME': <TokenType.LOCALTIME: 179>, 'LOCALTIMESTAMP': <TokenType.LOCALTIMESTAMP: 180>, 'LOCK': <TokenType.LOCK: 322>, 'MERGE': <TokenType.MERGE: 328>, 'NAMESPACE': <TokenType.NAMESPACE: 440>, 'NATURAL': <TokenType.NATURAL: 331>, 'NEXT': <TokenType.NEXT: 332>, 'NOT': <TokenType.NOT: 27>, 'NOTNULL': <TokenType.NOTNULL: 334>, 'NULL': <TokenType.NULL: 335>, 'OBJECT': <TokenType.OBJECT: 199>, 'OFFSET': <TokenType.OFFSET: 337>, 'ON': <TokenType.ON: 338>, 'OR': <TokenType.OR: 35>, 'XOR': <TokenType.XOR: 66>, 'ORDER BY': <TokenType.ORDER_BY: 341>, 'ORDINALITY': <TokenType.ORDINALITY: 344>, 'OUT': <TokenType.OUT: 345>, 'OUTER': <TokenType.OUTER: 347>, 'OVER': <TokenType.OVER: 348>, 'OVERLAPS': <TokenType.OVERLAPS: 349>, 'OVERWRITE': <TokenType.OVERWRITE: 350>, 'PARTITION': <TokenType.PARTITION: 352>, 'PARTITION BY': <TokenType.PARTITION_BY: 353>, 'PARTITIONED BY': <TokenType.PARTITION_BY: 353>, 'PARTITIONED_BY': <TokenType.PARTITION_BY: 353>, 'PERCENT': <TokenType.PERCENT: 354>, 'PIVOT': <TokenType.PIVOT: 355>, 'PRAGMA': <TokenType.PRAGMA: 360>, 'PRIMARY KEY': <TokenType.PRIMARY_KEY: 362>, 'PROCEDURE': <TokenType.PROCEDURE: 363>, 'OPERATOR': <TokenType.OPERATOR: 340>, 'QUALIFY': <TokenType.QUALIFY: 368>, 'RANGE': <TokenType.RANGE: 371>, 'RECURSIVE': <TokenType.RECURSIVE: 372>, 'REGEXP': <TokenType.RLIKE: 380>, 'RENAME': <TokenType.RENAME: 374>, 'REPLACE': <TokenType.REPLACE: 375>, 'RETURNING': <TokenType.RETURNING: 376>, 'REFERENCES': <TokenType.REFERENCES: 378>, 'RIGHT': <TokenType.RIGHT: 379>, 'RLIKE': <TokenType.RLIKE: 380>, 'ROLLBACK': <TokenType.ROLLBACK: 382>, 'ROLLUP': <TokenType.ROLLUP: 383>, 'ROW': <TokenType.ROW: 384>, 'ROWS': <TokenType.ROWS: 385>, 'SCHEMA': <TokenType.SCHEMA: 83>, 'SELECT': <TokenType.SELECT: 387>, 'SEMI': <TokenType.SEMI: 388>, 'SESSION': <TokenType.SESSION: 59>, 'SESSION_USER': <TokenType.SESSION_USER: 61>, 'SET': <TokenType.SET: 392>, 'SETTINGS': <TokenType.SETTINGS: 393>, 'SHOW': <TokenType.SHOW: 394>, 'SIMILAR TO': <TokenType.SIMILAR_TO: 395>, 'SOME': <TokenType.SOME: 396>, 'SORT BY': <TokenType.SORT_BY: 397>, 'SQL SECURITY': <TokenType.SQL_SECURITY: 399>, 'STRAIGHT_JOIN': <TokenType.STRAIGHT_JOIN: 402>, 'TABLE': <TokenType.TABLE: 84>, 'TABLESAMPLE': <TokenType.TABLE_SAMPLE: 405>, 'TEMP': <TokenType.TEMPORARY: 407>, 'TEMPORARY': <TokenType.TEMPORARY: 407>, 'THEN': <TokenType.THEN: 409>, 'TRUE': <TokenType.TRUE: 410>, 'TRUNCATE': <TokenType.TRUNCATE: 411>, 'TRIGGER': <TokenType.TRIGGER: 412>, 'UNION': <TokenType.UNION: 416>, 'UNKNOWN': <TokenType.UNKNOWN: 214>, 'UNNEST': <TokenType.UNNEST: 417>, 'UNPIVOT': <TokenType.UNPIVOT: 418>, 'UPDATE': <TokenType.UPDATE: 419>, 'USE': <TokenType.USE: 420>, 'USING': <TokenType.USING: 421>, 'UUID': <TokenType.UUID: 171>, 'VALUES': <TokenType.VALUES: 422>, 'VIEW': <TokenType.VIEW: 424>, 'VOLATILE': <TokenType.VOLATILE: 426>, 'WHEN': <TokenType.WHEN: 428>, 'WHERE': <TokenType.WHERE: 429>, 'WINDOW': <TokenType.WINDOW: 430>, 'WITH': <TokenType.WITH: 431>, 'APPLY': <TokenType.APPLY: 223>, 'ARRAY': <TokenType.ARRAY: 224>, 'BIT': <TokenType.BIT: 97>, 'BOOL': <TokenType.BOOLEAN: 98>, 'BOOLEAN': <TokenType.BOOLEAN: 98>, 'BYTE': <TokenType.TINYINT: 99>, 'MEDIUMINT': <TokenType.MEDIUMINT: 103>, 'INT1': <TokenType.TINYINT: 99>, 'TINYINT': <TokenType.TINYINT: 99>, 'INT16': <TokenType.SMALLINT: 101>, 'SHORT': <TokenType.SMALLINT: 101>, 'SMALLINT': <TokenType.SMALLINT: 101>, 'HUGEINT': <TokenType.INT128: 110>, 'UHUGEINT': <TokenType.UINT128: 111>, 'INT2': <TokenType.SMALLINT: 101>, 'INTEGER': <TokenType.INT: 105>, 'INT': <TokenType.INT: 105>, 'INT4': <TokenType.INT: 105>, 'INT32': <TokenType.INT: 105>, 'INT64': <TokenType.BIGINT: 107>, 'INT128': <TokenType.INT128: 110>, 'INT256': <TokenType.INT256: 112>, 'LONG': <TokenType.BIGINT: 107>, 'BIGINT': <TokenType.BIGINT: 107>, 'INT8': <TokenType.TINYINT: 99>, 'UINT': <TokenType.UINT: 106>, 'UINT128': <TokenType.UINT128: 111>, 'UINT256': <TokenType.UINT256: 113>, 'DEC': <TokenType.DECIMAL: 117>, 'DECIMAL': <TokenType.DECIMAL: 117>, 'DECIMAL32': <TokenType.DECIMAL32: 118>, 'DECIMAL64': <TokenType.DECIMAL64: 119>, 'DECIMAL128': <TokenType.DECIMAL128: 120>, 'DECIMAL256': <TokenType.DECIMAL256: 121>, 'DECFLOAT': <TokenType.DECFLOAT: 122>, 'BIGDECIMAL': <TokenType.BIGDECIMAL: 124>, 'BIGNUMERIC': <TokenType.BIGDECIMAL: 124>, 'BIGNUM': <TokenType.BIGNUM: 109>, 'LIST': <TokenType.LIST: 320>, 'MAP': <TokenType.MAP: 323>, 'NULLABLE': <TokenType.NULLABLE: 174>, 'NUMBER': <TokenType.DECIMAL: 117>, 'NUMERIC': <TokenType.DECIMAL: 117>, 'FIXED': <TokenType.DECIMAL: 117>, 'REAL': <TokenType.FLOAT: 114>, 'FLOAT': <TokenType.FLOAT: 114>, 'FLOAT4': <TokenType.FLOAT: 114>, 'FLOAT8': <TokenType.DOUBLE: 115>, 'DOUBLE': <TokenType.DOUBLE: 115>, 'DOUBLE PRECISION': <TokenType.DOUBLE: 115>, 'JSON': <TokenType.JSON: 141>, 'JSONB': <TokenType.JSONB: 142>, 'CHAR': <TokenType.CHAR: 125>, 'CHARACTER': <TokenType.CHAR: 125>, 'CHAR VARYING': <TokenType.VARCHAR: 127>, 'CHARACTER VARYING': <TokenType.VARCHAR: 127>, 'NCHAR': <TokenType.NCHAR: 126>, 'VARCHAR': <TokenType.VARCHAR: 127>, 'VARCHAR2': <TokenType.VARCHAR: 127>, 'NVARCHAR': <TokenType.NVARCHAR: 128>, 'NVARCHAR2': <TokenType.NVARCHAR: 128>, 'BPCHAR': <TokenType.BPCHAR: 129>, 'STR': <TokenType.TEXT: 130>, 'STRING': <TokenType.TEXT: 130>, 'TEXT': <TokenType.TEXT: 130>, 'LONGTEXT': <TokenType.LONGTEXT: 132>, 'MEDIUMTEXT': <TokenType.MEDIUMTEXT: 131>, 'TINYTEXT': <TokenType.TINYTEXT: 137>, 'CLOB': <TokenType.TEXT: 130>, 'LONGVARCHAR': <TokenType.TEXT: 130>, 'BINARY': <TokenType.BINARY: 139>, 'BLOB': <TokenType.VARBINARY: 140>, 'LONGBLOB': <TokenType.LONGBLOB: 135>, 'MEDIUMBLOB': <TokenType.MEDIUMBLOB: 134>, 'TINYBLOB': <TokenType.TINYBLOB: 136>, 'BYTEA': <TokenType.VARBINARY: 140>, 'VARBINARY': <TokenType.VARBINARY: 140>, 'TIME': <TokenType.TIME: 143>, 'TIMETZ': <TokenType.TIMETZ: 144>, 'TIME_NS': <TokenType.TIME_NS: 145>, 'TIMESTAMP': <TokenType.TIMESTAMP: 146>, 'TIMESTAMPTZ': <TokenType.TIMESTAMPTZ: 147>, 'TIMESTAMPLTZ': <TokenType.TIMESTAMPLTZ: 148>, 'TIMESTAMP_LTZ': <TokenType.TIMESTAMPLTZ: 148>, 'TIMESTAMPNTZ': <TokenType.TIMESTAMPNTZ: 149>, 'TIMESTAMP_NTZ': <TokenType.TIMESTAMPNTZ: 149>, 'DATE': <TokenType.DATE: 157>, 'DATETIME': <TokenType.DATETIME: 153>, 'INT4RANGE': <TokenType.INT4RANGE: 159>, 'INT4MULTIRANGE': <TokenType.INT4MULTIRANGE: 160>, 'INT8RANGE': <TokenType.INT8RANGE: 161>, 'INT8MULTIRANGE': <TokenType.INT8MULTIRANGE: 162>, 'NUMRANGE': <TokenType.NUMRANGE: 163>, 'NUMMULTIRANGE': <TokenType.NUMMULTIRANGE: 164>, 'TSRANGE': <TokenType.TSRANGE: 165>, 'TSMULTIRANGE': <TokenType.TSMULTIRANGE: 166>, 'TSTZRANGE': <TokenType.TSTZRANGE: 167>, 'TSTZMULTIRANGE': <TokenType.TSTZMULTIRANGE: 168>, 'DATERANGE': <TokenType.DATERANGE: 169>, 'DATEMULTIRANGE': <TokenType.DATEMULTIRANGE: 170>, 'UNIQUE': <TokenType.UNIQUE: 432>, 'VECTOR': <TokenType.VECTOR: 215>, 'STRUCT': <TokenType.STRUCT: 403>, 'SEQUENCE': <TokenType.SEQUENCE: 390>, 'VARIANT': <TokenType.VARIANT: 198>, 'ALTER': <TokenType.ALTER: 219>, 'ANALYZE': <TokenType.ANALYZE: 439>, 'CALL': <TokenType.COMMAND: 237>, 'COMMENT': <TokenType.COMMENT: 238>, 'EXPLAIN': <TokenType.COMMAND: 237>, 'GRANT': <TokenType.GRANT: 289>, 'REVOKE': <TokenType.REVOKE: 377>, 'OPTIMIZE': <TokenType.COMMAND: 237>, 'PREPARE': <TokenType.COMMAND: 237>, 'VACUUM': <TokenType.COMMAND: 237>, 'USER-DEFINED': <TokenType.USERDEFINED: 193>}
COMMANDS = {<TokenType.SHOW: 394>, <TokenType.COMMAND: 237>, <TokenType.EXECUTE: 270>, <TokenType.FETCH: 273>, <TokenType.RENAME: 374>}
COMMAND_PREFIX_TOKENS = {<TokenType.SEMICOLON: 19>, <TokenType.BEGIN: 229>}
NUMERIC_LITERALS: ClassVar[dict[str, str]] = {}
NUMBERS_CAN_HAVE_DECIMALS: ClassVar[bool] = True
COMMENTS = ['--', ('/*', '*/')]
dialect
def tokenize(self, sql: str) -> list[sqlglot.tokenizer_core.Token]:
576    def tokenize(self, sql: str) -> list[Token]:
577        """Returns a list of tokens corresponding to the SQL string `sql`."""
578        return self._core.tokenize(sql)  # type: ignore

Returns a list of tokens corresponding to the SQL string sql.

sql: str
580    @property
581    def sql(self) -> str:
582        """The SQL string being tokenized."""
583        return self._core.sql

The SQL string being tokenized.

size: int
585    @property
586    def size(self) -> int:
587        """Length of the SQL string."""
588        return self._core.size

Length of the SQL string.

tokens: list[sqlglot.tokenizer_core.Token]
590    @property
591    def tokens(self) -> list[Token]:
592        """The list of tokens produced by tokenization."""
593        return self._core.tokens

The list of tokens produced by tokenization.