如何将动态矩阵复制到CUDA中的设备存储器？

Question

在我的代码中，我有动态矩阵。

int ** file_data = (int **)malloc(TRANSACTIONS * sizeof(int *));
file_data[0] = (int *)malloc((a_size+1) * sizeof(int));
file_data[1] = (int *)malloc((a_size+1) * sizeof(int));
file_data[2] = (int *)malloc((a_size+1) * sizeof(int));
................................................................

我只想将其复制到设备全局内存一次。

我用过：

__device__ int raw_data[][];
...................................
...................................
...................................
cudaMemcpyToSymbol(raw_data[i], file_data[i], (a_size+1)*sizeof(int));

但这是行不通的。

我该怎么做？

Answer 1

您需要拼合数据

如果首先只使用矩形矩阵，则建议始终始终像这样存储矩阵，但是无论哪种方式，都需要先将其转换为这种形式，然后再尝试将这些数据推送到设备内存中。

template<typename T>
class Matrix {
    std::vector<T> _data;
    size_t rows, columns;
public:
    Matrix(size_t rows, size_t columns) :rows(rows), columns(columns) {
        _data.resize(rows * columns);
    }

    T & operator()(size_t row, size_t column) & {
        return _data.at(row * columns + column); //Row-Major Ordering
    }

    T const& operator()(size_t row, size_t column) const& {
        return _data.at(row * columns + column);
    }

    T operator() size_t row, size_t column) const {
        return _data.at(row * columns + column);
    }

    T * data() & {
        return _data.data();
    }

    T const* data() const& {
        return _data.data();
    }

    std::pair<size_t, size_t> size() const {
        return {rows, columns};
    }

    size_t flat_size() const {
        return rows * columns;
    }

    size_t byte_size() const {
        return flat_size() * sizeof(T);
    }
};

int ** file_data = (int **)malloc(TRANSACTIONS * sizeof(int *));
file_data[0] = (int *)malloc((a_size+1) * sizeof(int));
file_data[1] = (int *)malloc((a_size+1) * sizeof(int));
file_data[2] = (int *)malloc((a_size+1) * sizeof(int));
//................................................................

Matrix<int> flat_data(TRANSACTIONS, a_size + 1);
for(size_t row = 0; row < TRANSACTIONS; row++) {
    for(size_t column = 0; column < a_size + 1; column++) {
        flat_data(row, column) = file_data[row][column];
    }
}
//ALTERNATIVE: use this instead of your manual mallocs in the first place!

cudaMemcpyToSymbol(flat_data.data(), /*buffer name*/, flat_data.byte_size());

这样做的主要优点是您不必将每一行分别复制到它们自己的缓冲区中，您可以将所有行放到内存中，从而节省了内存并减少了需要进行的API调用次数。 当您尝试在原始代码中手动处理所有指针管理时不可避免地犯了一个错误时，专门为处理您的功能而设计的类将不会中断。

如何将动态矩阵复制到CUDA中的设备存储器？

问题描述

1 个解决方案

解决方案1
2 已采纳 2019-05-29 18:20:30

您需要拼合数据

如何将动态矩阵复制到CUDA中的设备存储器？

问题描述

1 个解决方案

解决方案1 2 已采纳 2019-05-29 18:20:30

您需要拼合数据

解决方案1
2 已采纳 2019-05-29 18:20:30