具有單引號，雙引號或三引號的Lex字符串

Question

我的目標是像Python一樣解析字符串。

問題：如何編寫詞法來支持以下內容：

"string..."
'string...'
"""multi line string \\n \\n end"""
'''multi line string \\n \\n end'''

一些代碼：

states = (
        ('string', 'exclusive'),
        )

# Strings
def t_begin_string(self, t):
    r'(\'|(\'{3})|\"|(\"{3}))'
    t.lexer.push_state('string')

def t_string_end(self, t):
    r'(\'|(\'{3})|\"|(\"{3}))'
    t.lexer.pop_state()

def t_string_newline(self, t):
    r'\n'
    t.lexer.lineno += 1

def t_string_error(self, t):
    print("Illegal character in string '%s'" % t.value[0])
    t.lexer.skip(1)

我目前的想法是創建4個唯一的狀態 ，以匹配4個不同的字符串大小寫，但是我想知道是否有更好的方法。

謝謝你的幫助！

Answer 1

隔離公共字符串以使其成為單個狀態，並嘗試構建具有較少狀態的自動機，但是如果您不擔心使用使您的工作更輕松的外部庫，則可以查看py yyacc

但是，您需要lex yacc的基礎///示例代碼如下所示

tokens = (
    'NAME','NUMBER',
    'PLUS','MINUS','TIMES','DIVIDE','EQUALS',
    'LPAREN','RPAREN',
    )
    enter code here

# Tokens

t_PLUS    = r'\+'
t_MINUS   = r'-'
t_TIMES   = r'\*'
t_DIVIDE  = r'/'
t_EQUALS  = r'='
t_LPAREN  = r'\('
t_RPAREN  = r'\)'
t_NAME    = r'[a-zA-Z_][a-zA-Z0-9_]*'

def t_NUMBER(t):
    r'\d+'
    try:
        t.value = int(t.value)
    except ValueError:
        print("Integer value too large %d", t.value)
        t.value = 0
    return t

# Ignored characters
t_ignore = " \t"

def t_newline(t):
    r'\n+'
    t.lexer.lineno += t.value.count("\n")

def t_error(t):
    print("Illegal character '%s'" % t.value[0])
    t.lexer.skip(1)

# Build the lexer
import ply.lex as lex
lex.lex()

# Parsing rules

precedence = (
    ('left','PLUS','MINUS'),
    ('left','TIMES','DIVIDE'),
    ('right','UMINUS'),
    )

# dictionary of names
names = { }

def p_statement_assign(t):
    'statement : NAME EQUALS expression'
    names[t[1]] = t[3]

def p_statement_expr(t):
    'statement : expression'
    print(t[1])

def p_expression_binop(t):
    '''expression : expression PLUS expression
                  | expression MINUS expression
                  | expression TIMES expression
                  | expression DIVIDE expression'''
    if t[2] == '+'  : t[0] = t[1] + t[3]
    elif t[2] == '-': t[0] = t[1] - t[3]
    elif t[2] == '*': t[0] = t[1] * t[3]
    elif t[2] == '/': t[0] = t[1] / t[3]

def p_expression_uminus(t):
    'expression : MINUS expression %prec UMINUS'
    t[0] = -t[2]

def p_expression_group(t):
    'expression : LPAREN expression RPAREN'
    t[0] = t[2]

def p_expression_number(t):
    'expression : NUMBER'
    t[0] = t[1]

def p_expression_name(t):
    'expression : NAME'
    try:
        t[0] = names[t[1]]
    except LookupError:
        print("Undefined name '%s'" % t[1])
        t[0] = 0

def p_error(t):
    print("Syntax error at '%s'" % t.value)

import ply.yacc as yacc
yacc.yacc()

while 1:
    try:
        s = input('calc > ')   # Use raw_input on Python 2
    except EOFError:
        break
    yacc.parse(s)

Answer 2

嘗試使用pyparsing模塊。 使用此模塊，您可以輕松解析具有良好樣式的字符串，而無需使用正則表達式。

以下示例還應幫助您解析諸如"string..."和"""string"""類的表達式。

from pyparsing import Word, OneOrMore, alphas

string = """string"""
w = OneOrMore('\"') + Word(alphas + '.') + OneOrMore('\"')
w.parseString(string)

具有單引號，雙引號或三引號的Lex字符串

問題描述

2 個解決方案

解決方案1
1 2014-10-13 17:32:00

解決方案2
0 2014-10-06 10:58:40

具有單引號，雙引號或三引號的Lex字符串

問題描述

2 個解決方案

解決方案1 1 2014-10-13 17:32:00

解決方案2 0 2014-10-06 10:58:40

解決方案1
1 2014-10-13 17:32:00

解決方案2
0 2014-10-06 10:58:40