如何在python中使用自定义Apache Avro字段类型

Question

我已经可以访问Apache Kafka集群，并且获得了一个描述消息的Apache Avro序列化格式的文件。 我正在用python编写一个小型测试使用者，尝试解析模式时遇到以下错误：

SchemaParseException: Type property "{u'items': u'com.myapp.avromsg.common.MilestoneField', u'type': u'array'}" not a valid Avro schema: Items schema (com.myapp.avromsg.common.MilestoneField) not a valid Avro schema: Could not make an Avro Schema object from com.myapp.avromsg.common.MilestoneField. (known names: [u'com.myapp.avromsg.runstatus.RunStatusMessage'])

在我看来，该错误是由于不了解自定义字段类型MilestoneField而引起的。 我应该如何在脚本中描述该字段，以便序列化格式能够正确解析？

这是my_msg.avsc avro文件：

{
  "type": "record",
  "name": "RunStatusMessage",
  "namespace": "com.myapp.avromsg.runstatus",
  "fields": [
    {
      "name": "datasetID",
      "type": "string"
    },
    {
      "name": "runID",
      "type": ["string", "null"]
    },
    {
      "name": "registryRunID",
      "type": ["string", "null"]
    },
    {
      "name": "status",
      "type": "string"
    },
    {
      "name": "logs",
      "type": ["string", "null"]
    },
    {
      "name": "jobID",
      "type": ["string", "null"]
    },
    {
      "name": "validationsJson",
      "type": ["string", "null"]
    },
    {
      "name": "zone",
      "type": "string"
    },
    {
      "name": "milestoneFields",
      "type": {
        "type": "array",
        "items": "com.myapp.avromsg.common.MilestoneField"
      }
    },
    {
      "name": "ingestionParams",
      "type": {
        "type": "array",
        "items": "com.myapp.avromsg.common.MilestoneField"
      },
      "default": []
    },
    {
      "name": "timestamp",
      "type": [
        {
          "type": "long",
          "logicalType": "timestamp-millis"
        },
        {
          "type": "bytes",
          "logicalType": "decimal",
          "precision": 38,
          "scale": 0
        },
        "string",
        "int",
        "null"
      ]
    }
  ]
}

这是我到目前为止使用的代码：

import avro.schema
schema = avro.schema.parse(open('my_msg.avsc', 'rb').read())

Answer 1

不知道如何在pyhon中进行编码，但是我可以提供Java版本（我希望它应该几乎相同）。 您有两种选择，包括将MilestoneField对象的定义作为模式的一部分（如果在多个部分中使用，则根本不干净）或向Schema.Parser添加其他类型。 在该示例中，我对模式进行了硬编码，但是从文件中读取的内容是相同的

public static void main(String [] args){
    Schema.Parser parser = new Schema.Parser();

    Schema pojo = new Schema.Parser().parse("{\n" +
            "  \"namespace\": \"io.fama.pubsub.schema\",\n" +
            "  \"type\": \"record\",\n" +
            "  \"name\": \"Pojo\",\n" +
            "  \"fields\": [\n" +
            "    {\n" +
            "      \"name\": \"field\",\n" +
            "      \"type\": \"string\"\n" +
            "    }\n" +
            "  ]\n" +
            "}");

    HashMap<String, Schema> extraTypes = new HashMap<>();
    extraTypes.put("Pojo", pojo);
    parser.addTypes(extraTypes);

    Schema schema = parser.parse("{\n" +
            "  \"namespace\": \"io.fama.pubsub.schema\",\n" +
            "  \"type\": \"record\",\n" +
            "  \"name\": \"PojoCollection\",\n" +
            "  \"fields\": [\n" +
            "    {\n" +
            "      \"name\": \"pojosCollection\",\n" +
            "      \"type\": {\n" +
            "        \"type\": \"array\",\n" +
            "        \"items\": \"Pojo\"\n" +
            "      }\n" +
            "    }, {\n" +
            "      \"name\": \"additionaField\",\n" +
            "      \"type\": [\"null\", \"string\"]\n" +
            "    }\n" +
            "  ]\n" +
            "}");
}

如您所见，您可以使用addTypes方法在架构中包括其他自定义对象。 方法参数是Map<string,Schema>因此您需要先解析自定义对象架构。 现在，如果您拥有架构的类版本（由avro生成），则应该可以像这样添加它

    extraTypes.put("MilestoneField", MilestoneField.SCHEMA$);

Answer 2

假设我有定义我的自定义字段和消息架构的avsc文件，这就是我如何使用python avro做到这一点

import avro.schema
import json

schema_list = []

# First add the custom field to the schema list
custom_json = json.loads(open('custom_field.avsc', 'rb').read())
schema_list.append(custom_json)

# Then add the main message schema
main _json = json.loads(open('main _msg.avsc', 'rb').read())
schema_list.append(main _json)

# Convert the schema json to a JSON string
schema_json = json.dumps(schema_list)

# Parse the schema
full_msg_schema = avro.schema.parse(schema_json)

如何在python中使用自定义Apache Avro字段类型

问题描述

2 个解决方案

解决方案1
0 2018-03-23 12:30:02

解决方案2
0 已采纳 2018-03-28 10:08:13

如何在python中使用自定义Apache Avro字段类型

问题描述

2 个解决方案

解决方案1 0 2018-03-23 12:30:02

解决方案2 0 已采纳 2018-03-28 10:08:13

解决方案1
0 2018-03-23 12:30:02

解决方案2
0 已采纳 2018-03-28 10:08:13