繁体   English   中英

这个 UTF-8 中的 BOM 不正确吗?

[英]Is this BOM in UTF-8 incorrect?

我想验证 UTF-8 中的 BOM,并编写了下面的 c++ 代码。

但是,结果是0XFFFFFFEF, 0XFFFFFFBB, 0XFFFFFFBF

这与我预期的0XEF, 0XBB, 0XBF 不同

为什么结果变成了上面?

顺便说一下,使用的 UTF-8 文件是由 Notepad++ 制作的。

#include <iostream>
#include <fstream>

using namespace std;

int main()
{
        char file[]="/*UTF-8 file*/"; 
        
        char a[3]{};

        ifstream ifs(file, ios_base::binary);
        
        ifs.read(a, static_cast<streamsize>(sizeof(a)));
        
        cout << showbase << uppercase;
        
        for(int i:a){
                cout << hex << i << endl;
        }
}

环境

海湾合作委员会 9.2.0

编译选项:-std=c++2a

BOM 本身没问题。 您只是错误地打印出字节。

您看到的结果是由于将有符号的8 位char符号扩展为有符号的 32 位整数。 char是有符号还是无符号是编译器定义的,除非您在代码中明确说明。 在您的情况下,您正在使用(隐式)签名char 有符号char值 > 127 将其高位设置为 1,这将在将有符号 8 位值扩展为有符号 32 位值时用 1 填充新位。

要正确输出字节,您需要对值进行零扩展,而不是符号扩展。 为此使用unsigned类型,例如:

#include <iostream>
#include <fstream>

using namespace std;

int main()
{
    char file[] = "/*UTF-8 file*/";
    unsigned char a[3];

    ifstream ifs(file, ios_base::binary);
    ifs.read(reinterpret_cast<char*>(a), sizeof(a));

    cout << showbase << uppercase;

    for(unsigned int i : a){
        cout << hex << setw(2) << setfill(‘0’) << i << endl;
    }
}

暂无
暂无

声明:本站的技术帖子网页,遵循CC BY-SA 4.0协议,如果您需要转载,请注明本站网址或者原文地址。任何问题请咨询:yoyou2525@163.com.

 
粤ICP备18138465号  © 2020-2024 STACKOOM.COM