ChatGPT インタビュー記事 同じ|5人取材したのに全員同じ声になる原因と対処法

ChatGPTで社員インタビュー記事を書くと全員同じ口調になる構造的な原因と、話者の個性を残すための7つの実務テクニック、音声文字起こしを使った根本的な解決策を解説。

description

ChatGPTで社員インタビュー記事を書くと、5人全員が同じ口調になる。LLMが「平均的に無難な続き」を選ぶ構造的な原因と、話者の個性を残すための7つの実務テクニック、音声文字起こしを使った根本的な解決策を解説。


5人の社員にインタビューして、AIで記事を書いたら、全員が同じトーンで語っている記事になってしまった――採用サイトやオウンドメディアで社員インタビューをAIで効率化した担当者の多くが直面する課題です。

結論から言うと、これはLLMの構造的な性質(mode collapse)に起因し、プロンプトで話者プロフィールを詳細に渡せば改善しますが、文字に起こされた要約からは口癖・間・テンポは復元できません。話者の個性を残すには、実際の発話データ(音声文字起こし)を素材にする必要があります。

本記事では、なぜChatGPTが全員を同じ声にしてしまうのかという構造的な原因を学術的な裏付けとともに解説し、プロンプトでできる7つの対処法を具体的に示し、それでも残る限界と根本的な解決策を提示します。

なぜインタビュー記事で個性を残すことが重要かについては、インタビュー記事作成完全ガイド|質問設計とテンプレート付きで詳しく解説しています。


5人にインタビューしたのに、記事が5つとも同じ声になっている

採用サイトに5人分の社員インタビュー記事を載せたとき、写真を差し替えても記事として成立してしまう状態になっていたら、それは個性が消えている証拠です。

こんな症状が出ていませんか

  • 「〜と語る」「次のように述べた」が全員同じ

インタビュー記事によくある表現ですが、全記事でこれだけが繰り返されていると、書き手の癖であって話者の個性ではないことがわかります。

  • エピソードの語り方が均質

困難を乗り越えた話、成長した瞬間、やりがいを感じる場面――内容は違うのに、語り口が全員同じテンポ、同じ丁寧さ、同じ構成になっている。

  • 口癖や言い回しの違いが消えている

実際の会話では「要するに」「逆に言うと」「あの……」などの口癖があり、文末の言い切り方も人によって違います。それが全員「〜だと思います」「〜でした」に統一されている。

  • 年齢・入社年次・職種の違いが文体に反映されていない

新入社員とベテランが同じ丁寧さで語り、技術職と営業職の語彙の違いが見えない。

これらが当てはまるなら、あなたの記事は「誰が語っているか」が伝わらず、読者は全員を同じ人として認識しています。


なぜChatGPTは全員を同じ声にしてしまうのか

ChatGPTが複数の社員インタビュー記事を同じ声にしてしまうのは、プロンプトの書き方が悪いからではなく、LLM(大規模言語モデル)の生成原理そのものに原因があります。

LLMは「最も確率の高い続き」を選ぶ = 平均に収束する

LLMは、訓練データ内で「この文脈の次に来る単語」として最も頻度が高いものを選びます。これが積み重なると、どのユーザーの指示に対しても「最も無難で、最も平均的な文章」が生成されます。

この現象はmode collapse(モード崩壊)と呼ばれ、学術的にも実証されています。

Sourati, Ziabari, & Dehghani (2025) の研究によれば、LLMは訓練データ内の支配的なスタイルを反映・強化し、代替的な声や推論を周縁化します。全ユーザーが同じモデルに依存することで、この収束効果はさらに増幅されます。

採用サイトで5人分のインタビュー記事をAIツールに依頼すると、5人全員が「インタビュー記事で最も無難な語り口」に統一されてしまうのは、この原理の直接的な帰結です。

入力が箇条書きメモだと、個性を再現する材料がない

「営業部の佐藤さん:入社3年目、顧客との信頼関係を重視、成約まで平均3ヶ月」というメモをAIに渡しても、佐藤さんがどんな口調で語るか、どんな言い回しをするかは、メモのどこにも書かれていません。

AIは無い情報を推測で補いますが、その推測は訓練データの平均――つまり「インタビュー記事として最も無難な語り口」になります。技術部の田中さんにも同じことが起きるので、結果として全員同じ声になります。

多様性の喪失は全体を貧困化させる

Rios-Sialer (2026) は、生成AIモデルが訓練データ中の人間のバイアスを再現し、mode collapse等のメカニズムでさらに増幅することを指摘しています。

多様性の喪失は少数派を害するだけでなく、コンテンツ全体の質を貧困化させる――この警告は、採用サイトのコンテンツにもそのまま当てはまります。全員が同じ声で語る採用サイトは、求職者にとって「誰が語っているのかわからない、顔の見えない会社」になります。


プロンプトで話者の個性を出す7つのテクニック

LLMの構造的な問題は理解した上で、それでもプロンプトの工夫で一定の差別化は可能です。以下の7つのテクニックを組み合わせることで、少なくとも「写真を差し替えても成立してしまう」状態からは脱却できます。

テクニック1:話者プロフィールシートを作る

AIに渡す情報を、「年齢・入社年・所属」だけでなく、話し方の特徴まで含めたプロフィールシートに拡張します。

佐藤花子(営業部、入社3年目、28歳)
- 口癖:「要するに」「逆に言うと」
- 話すテンポ:ゆっくり、考えながら話す
- 文末の癖:「〜だと思うんですよね」と語尾を伸ばす
- よく使う語彙:「信頼関係」「長期的に」
- 言わない表現:堅苦しい敬語(「〜でございます」等)は使わない

このシートを各話者ごとに作り、記事生成時にプロンプトの冒頭に埋め込みます。

テクニック2:インタビュー中のメモではなく、逐語的な発言を渡す

「顧客との信頼を大切にしている」というメモではなく、「要するに、私が大事にしてるのは、お客さんとの信頼関係なんですよね」という実際の発言をそのまま渡します。

箇条書きメモは話者の口調を捨てたデータです。ChatGPTに個性を出させたいなら、個性が残っているデータを入力する必要があります。

テクニック3:「この人はこう言わない」ネガティブ指示を加える

「〜と語る」「次のように述べた」は便利な表現ですが、全員に使うと書き手の癖になります。

プロンプトに次のような指示を加えます。

- 佐藤さんは堅苦しい敬語(「〜でございます」等)は使わない
- 田中さんは「やりがい」という言葉を使わず、具体的な成果物で説明する

「こう書いてほしい」だけでなく「こうは書かないでほしい」を明示することで、書き分けの精度が上がります。

テクニック4:話者ごとにプロンプトを分ける

5人分の情報を1つのプロンプトにまとめて渡すと、AIは5人を「インタビュー対象者A〜E」としてバッチ処理し、差別化が甘くなります。

1人ずつ別のプロンプトで記事を生成し、各プロンプトにその人だけのプロフィールシートを埋め込むことで、話者ごとの独立性を保ちます。

テクニック5:1記事ずつ「前の記事と同じ表現を使うな」と指示する

2人目以降の記事を生成するときは、プロンプトに次を追加します。

前回の記事では「〜と語る」「やりがいを感じる」という表現を使った。今回の記事では、これらの表現を避け、別の言い回しで書いてください。

これは手間ですが、同じ表現の繰り返しを防ぐ最も確実な方法です。

テクニック6:出力後に「この記事の話者を当ててください」テストを行う

生成した記事5本を並べて、AIに次のように問います。

以下の5本の記事から、話者の名前を伏せた文章を1つ抜き出します。この文章を書いたのは誰か、プロフィールシートの情報だけから推測してください。

「要するに、私が大事にしてるのは、お客さんとの信頼関係なんですよね。」

これで話者を特定できなければ、記事に個性が出ていないことの証明です。プロンプトを見直して再生成します。

テクニック7:推敲は人間がやる。最後の文体調整だけで個性が戻る

AIに完璧な個性の再現を期待するのではなく、8割まで仕上げてもらい、残りの2割を人間が調整する運用が現実的です。

特に次の作業は人間が行うと効果的です。

  • 同じ語尾(「〜だと思います」「〜でした」)が3回以上続いていたら、1つを言い換える
  • 「やりがい」「成長」のような抽象語が出てきたら、その人固有のエピソードに置き換える
  • 口癖として設定した表現が1回も出ていなければ、適切な箇所に挿入する

それでも残る限界――テキスト要約からは復元できないもの

上記の7つのテクニックを全て実行しても、入力がテキスト要約である限り、再現できない個性があります。

口癖、言い淀み、語尾の上がり方はメモに残らない

実際の会話では、「あの……」から始まる迷い、「えーっと」という考える間、「〜ですよね?」と語尾を上げて確認する癖――これらが話者の個性を作ります。

しかしメモを取る段階でこれらは全て削ぎ落とされ、「顧客との信頼を重視」という要約だけが残ります。要約からは、元の発話の個性は復元できません。

「あの……」から始まる本音、笑い声の後のひと言

インタビューで最も価値があるのは、言い淀んだ後に出てくる本音や、笑いながら語る失敗談です。これらは音声でしか残りません。

文字起こしなら「あの……、実は最初の3ヶ月は辞めたいと思ってました(笑)」がそのまま記録されますが、メモでは「入社直後は苦労したが乗り越えた」という要約になり、迷いも笑いも消えます。

プロンプトの精度に関係なく、入力の解像度が天井になる

どれだけ精緻なプロンプトを書いても、入力データに含まれていない情報は生成できません。

入力が箇条書きメモ(解像度:低)なら、出力も「平均的な語り口」(解像度:低)にしかなりません。入力が音声文字起こし(解像度:高)なら、出力も「話者の口調を残した記事」(解像度:高)になります。

「入力解像度 × 出力調整」マトリクス

入力出力調整結果
箇条書きメモなし全員同じ声(最悪)
箇条書きメモプロンプトで話者指示やや改善
逐語録(文字起こし)なし個性が自動的に残る
逐語録(文字起こし)プロンプトで構成指示個性+読みやすさの両立

話者の声を残す選択肢:音声→文字起こし→編集

話者の個性を本質的に残すには、音声を素材にする必要があります。

音声文字起こしを使えば、インタビューの録音をそのままテキストに変換し、話者ごとの口調・間・フィラー(「えーっと」「あの」)を保持したまま記事化できます。ChatGPTに要約を渡すのではなく、実際の発話を渡すことになるため、プロンプトで無理に個性を指示する必要がなくなります。

sonataは、インタビュー音声をアップロードすると、複数の話者を自動で識別・分離(話者分離)し、各人の発言をそのままテキスト化します。メディア設定を反映した記事原稿を生成するため、口調を残したまま読みやすい記事に仕上げられます。

採用サイトで5人の社員インタビューを書く場合、5人の録音を1本ずつアップロードすれば、それぞれの口調を保った5本の記事が生成されます。 あとは人間が最終チェックと微調整を行うだけで、「写真を差し替えても成立してしまう」問題から脱却できます。


採用担当者が現場で直面する5つの疑問

何人分のインタビューまでならAIだけで書き分けられますか?

明確な閾値はありませんが、3人を超えると差別化が困難になる傾向があります。2人までなら「ベテラン vs 新人」「技術職 vs 営業職」のような対比で書き分けられますが、5人になると対比構造が崩れ、全員が平均化しやすくなります。

録音できない場面(チャット/メール取材)での個性の残し方は?

テキスト素材でも、その人固有の語彙・言い回しをそのまま渡せば一定の差別化は可能です。メール取材なら返信内容をそのまま引用し、チャット取材ならログを編集せずに渡します。ただし音声ほどの解像度は期待できないため、最終的には人間の推敲が必須です。

社員に記事確認してもらうタイミングはいつがベストですか?

構成確定後と、公開前の2回が推奨です。個性の観点では、「これ私の言い方じゃない」と指摘してもらう段階が重要です。公開直前だけだと、大幅な修正が難しくなります。

プロフィールシートの作成は誰がやるべきですか?

理想はインタビューを実施した担当者ですが、時間がない場合は録音を聞き直して口癖・語尾の癖をメモするだけでも効果があります。もし録音がない場合は、過去の発言(社内Slack、議事録、メール)から言い回しの癖を拾います。

音声文字起こしを使っても個性が消えることはありますか?

あります。文字起こしの精度が低い場合(フィラーや口癖が削除される設定、話者分離の誤認識)や、記事生成時のプロンプトで「丁寧に整える」と指示しすぎた場合です。文字起こしツールは「逐語」設定を選び、記事生成時には「口調を残したまま、読みやすく整理する」と指示するのがコツです。