ITパスポート 2013年 春期 問78
問題文
世界の主要な言語で使われている文字を一つの文字コード体系で取り扱うための規格はどれか。
選択肢
ア:ASCII
イ:EUC
ウ:SJIS(シフトJIS)
エ:Unicode(正解)
🔒 解説は解答すると表示されます
世界の主要な言語で使われている文字を一つの文字コード体系で取り扱うための規格はどれか。【ITパスポート 解説】
正解の理由
世界の主要な言語(英語・日本語・中国語・アラビア語など)にある多数の文字を一つの体系で扱える規格は エ の Unicode です。Unicode は各文字に一意の番号(コードポイント)を割り当て、世界中の文字を統一して扱えるように設計されています。したがって「多言語を一つの文字コード体系で取り扱う」という条件に最も合致します。
解法ステップ
- 問題文のキーワードを探す:「世界の主要な言語」「一つの文字コード体系」→ 多言語対応がポイント。
- 選択肢の特徴を思い出す:
- ASCII:英語向けの基本的な文字集合(文字数が少ない)。
- EUC/SJIS:日本語など特定言語向けのエンコーディング(多言語汎用ではない)。
- Unicode:世界中の文字をカバーするための規格。
- 多言語対応が必要なので、Unicode を選ぶ(エ)。
選択肢別の誤答解説
-
ア: ASCII(American Standard Code for Information Interchange:英語の基本文字用)
- 英語の大文字・小文字・数字・記号などの基本文字を表す古典的な規格です。割り当ては 0~127 の 128文字が中心で、英語以外の多くの文字(日本語・中国語など)は含まれません。したがって「世界の主要な言語を一つで扱う」用途には不十分です。
-
イ: EUC(Extended Unix Code:UNIX 系で使われた拡張文字コード)
- 主に UNIX 系システムで日本語(EUC-JP)や韓国語(EUC-KR)など個別言語向けのバリエーションがあります。多言語を単一で完全にカバーする規格ではありません。
-
ウ: SJIS(Shift_JIS:日本語を表すために開発された文字コード)
- 日本語を扱うための文字コードで、Windows や古いシステムで使われてきました。日本語向けには便利ですが、世界の主要言語すべてを扱う規格とは言えません。
-
エ: Unicode
- 各文字に対して一意の「コードポイント」(例: は 'A')を割り当て、世界中の多くの言語の文字を含む規格です。さらに UTF-8 や UTF-16 といった「エンコーディング(符号化方式:数値をバイト列に変換する方法)」で実際のバイト列として表現します。
よくある誤解
- 「Unicode」と「UTF-8」を同じものと考える誤解
- Unicode は「文字に番号を与える規格(文字集合)」、UTF-8 はその番号(コードポイント)を「バイト列」に変換する方法(エンコーディング)です。違いを分けて覚えましょう。
- 「SJIS や EUC は多言語対応だ」と考える誤解
- SJIS や EUC は主に日本語や一部の言語に特化して設計された方式です。世界中の文字を統一して扱う設計ではありません。
補足コラム
- Unicode の仕組み(簡単に)
- Unicode は「各文字に番号(コードポイント)を割り当てる」仕組みです。例:英大文字 A は 。漢字や絵文字にもそれぞれ の形でコードが割り当てられています。
- 実際にファイルや通信で使うときは UTF-8 や UTF-16 といったエンコーディングでバイト列に変換します。現在、ウェブでは UTF-8 が主流です。
- 覚え方のコツ
- 「ASCII は英語向けの小さな箱」「SJIS/EUC は日本語向けの箱」「Unicode は世界をまとめる大きな箱」とイメージすると混同しにくいです。
(参考の小さなコード例:文字のコードポイントを見る)
s = "A あ 😀"
for ch in s:
print(ch, hex(ord(ch)))
# エンコーディング例
print("UTF-8 bytes:", s.encode("utf-8"))
FAQ
Q. 試験で「Unicode」と出てきたら必ず正解ですか?
A. 多言語を一つで扱うという設問であれば Unicode が正解になります。問題文の条件を確認してください(例:「英語だけ」などの場合は別の選択肢が正しい可能性あり)。
A. 多言語を一つで扱うという設問であれば Unicode が正解になります。問題文の条件を確認してください(例:「英語だけ」などの場合は別の選択肢が正しい可能性あり)。
Q. UTF-8 の「UTF」は何の略ですか?
A. UTF は "Unicode Transformation Format" の略で、Unicode のコードポイントをバイト列に変換する方式を指します(例:UTF-8、UTF-16)。
A. UTF は "Unicode Transformation Format" の略で、Unicode のコードポイントをバイト列に変換する方式を指します(例:UTF-8、UTF-16)。
Q. どうして UTF-8 がよく使われるのですか?
A. UTF-8 は英数字(ASCII部分)を従来の 1 バイト表現と互換に保ちつつ、多言語文字を可変長で表現でき、スペース効率と互換性のバランスが良いため、ウェブ等で広く採用されています。
A. UTF-8 は英数字(ASCII部分)を従来の 1 バイト表現と互換に保ちつつ、多言語文字を可変長で表現でき、スペース効率と互換性のバランスが良いため、ウェブ等で広く採用されています。
関連キーワード: Unicode、UTF-8、文字コード、コードポイント、ASCII、EUC、SJIS、エンコーディング、UTF-16

\ せっかくなら /
ITパスポートを
クイズ形式で学習しませんか?
クイズ画面へ遷移する→
すぐに利用可能!

