Gemini 3.5 Transcribeの使い方と会議での活用法

会議の議事録づくりに、毎回30分〜1時間を溶かしていませんか。録音を聞き返しながら「えーと」「あの」を手作業で削り、話がそれた部分を整理する作業は地味に負担が大きいものです。2026年8月27日、Googleが発表した新しい音声認識モデル「Gemini 3.5 Transcribe」は、この言い淀み除去を自動化する点が特徴です。本記事では、現時点で実際にどこで使えるのか、会議・インタビューでどう活用できるのかを、非エンジニアの方にもわかる形で整理します。
結論|Gemini 3.5 Transcribeは「フィラー除去」に強い最新の音声認識AI
Gemini 3.5 Transcribeは、話者の「えーと」「あの」といったつなぎ言葉や言い直しを自動で取り除き、読みやすい形に整えて文字起こしするAIモデルです。現時点ではAndroid版Gboardの音声入力機能「Rambler」を通じて利用でき、今後Chrome・Google ドキュメント・Gmail・Keepなどへの展開も予定されています。会議の議事録やインタビューの文字起こしに時間を取られている方にとっては、聞き返しながらの手作業を減らせる可能性がある機能です。ただし2026年8月末時点ではまだ展開の途中で、使える場所が限られている点は押さえておく必要があります。
Gemini 3.5 Transcribeとは?2026年8月27日発表の要点
Gemini 3.5 Transcribeは、Googleが2026年8月26日(現地時間、日本時間27日)に発表した音声認識モデルです。従来モデルの「Chirp 3」の後継にあたり、雑音や専門用語、言い直しの多い発話への対応力が向上したとされています。開発者向けには、低遅延でのリアルタイム変換に対応する「Live API」と、録音済み音声を話者ごとに分けて書き起こせる「Interactions API」の2種類が用意されており、後者では単語単位のタイムスタンプ付与や最大3人までの話者識別にも対応します。
WER(単語誤り率)は計測方法によって数値が異なる点に注意
Googleは自社発表の中で「Artificial Analysis」による計測値として、非ストリーミング時のWER(単語誤り率、低いほど高精度)が2.6%、ストリーミング時が4.0%だったと紹介しています。一方、多言語ベンチマーク「FLEURS」では非ストリーミング5.04%、ストリーミング5.50%という、やや異なる数値も公表されています。いずれもGoogleが選んで開示した計測値であり、第三者機関による横並びの独立検証ではない点は踏まえておくとよいでしょう。数値の高さそのものより「実際に自分の会議やインタビューの音声で試してどう感じるか」を基準に判断するのが実用的です。
「えーと」「あの」を自動除去する言い淀み補正
「火曜日に会いましょう、あー、いや水曜日で」といった言い直しを「水曜日に会いましょう」と整理したり、フィラー(つなぎ言葉)を取り除いて文章の体裁を自動で整えたりする機能が搭載されています。話し手の意図をくんだうえでテキストを出力する設計のため、単に音を文字に変換するだけの従来型の音声認識とは仕上がりの読みやすさが変わってきます。
カスタム語彙機能とは
あらかじめ専門用語や社内独自の表記、綴りが難しい固有名詞などを登録しておくと、文字起こし時にその通りの表記へ自動で補正してくれる機能です。業界用語や商品名・人名が多く登場する会議やインタビューでは、この機能の有無で修正作業の手間が変わってきます。
現時点で使える場所と今後の展開予定
Gemini 3.5 Transcribeは発表直後の段階のため、一般ユーザーがすぐに触れられる場所は限られています。ここを整理せずに「使い方」だけを解説している記事が多いため、まずは現状を正確に把握しておきましょう。
今すぐ使える:Android版Gboard「Rambler」
日本語では、Android端末のGboard(グーグルの入力アプリ)に搭載された音声入力機能「Rambler」を通じてGemini 3.5 Transcribeの精度を体験できます。キーボードアプリの音声入力ボタンから利用でき、追加の登録や設定は不要です。まずは普段のメッセージ入力やメモ書きで試してみると、フィラー除去や言い直しの補正がどの程度効くか体感しやすいでしょう。
展開予定:Chrome・Docs・Gmail・Keep
Google公式の発表では、Chrome・Google ドキュメント・Gmail・Google Keep・macOS版Geminiアプリなど、Googleの各種プロダクトへの統合が今後進められるとされています。ブラウザの入力欄やメール返信、メモアプリでの音声入力にGemini 3.5 Transcribeが使われるようになれば、会議の議事録作成やメールの下書きなど、テキスト入力全般での活用が広がる見込みです。ただし提供時期は明言されておらず、順次展開という段階である点には注意してください。
会議の議事録作成での使い方
会議での活用イメージは次の通りです。会議を録音しておき、その音声をGemini 3.5 Transcribeで文字起こしすると、フィラーが除去された読みやすいテキストが得られます。そのテキストをGeminiやClaudeなどの生成AIに渡して「要点を5つにまとめて」と依頼すれば、議事録の下書きが短時間でできあがります。これまで録音を聞き返しながら30分〜1時間かけていた作業を、文字起こしと要約の2ステップに分けて短縮できる可能性があります。ただし現状はAndroidのGboard経由が中心のため、PCでの会議(Web会議ツールの録音データなど)にそのまま使うには、今後のChrome・Docs展開を待つ必要があります。
インタビュー・1on1での使い方と話者識別の活用
上司と部下の面談、採用面接、顧客ヒアリングといった1対1〜少人数の会話では、Interactions APIの話者識別機能(最大3人まで)が役立ちます。「誰が何を言ったか」を区別して書き起こせるため、後から正確に振り返りたい場面に向いています。専門用語が多いインタビューでは、カスタム語彙機能に事前に用語を登録しておくと、修正の手間を減らせます。なお話者識別や単語単位のタイムスタンプは開発者向けAPIの機能であり、一般ユーザーがGboard経由ですぐに使えるわけではない点は理解しておきましょう。
既存の録音アプリ・AIボイスレコーダーとの使い分け
Gemini 3.5 Transcribeは、あくまでGoogleのOS・アプリに組み込まれた「音声入力・文字起こし機能」です。裏を返せば、録音そのものを安定して残す専用機能ではないため、重要な会議やインタビューで「録音の取りこぼし」が許されない場面では、別の手段を組み合わせておくと安心です。
そうした用途では、録音・文字起こし・要約までをワンボタンでこなせるAIボイスレコーダー「Plaud」のような専用デバイスが選択肢になります。
ボタンを長押しするだけで録音を開始でき、複数のLLMを使った112言語対応の文字起こしと話者識別、要約テンプレートまでを一台で完結できる点が特徴です。Gemini 3.5 Transcribeを「普段のメモ書きや音声入力の効率化」に使い、重要な会議やインタビューの記録は専用デバイスに任せる、という役割分担で考えると失敗が少ないでしょう。
一方で、Plaudのような専用デバイスは本体の購入費用がかかり、Gemini 3.5 Transcribeのようにスマートフォンに標準搭載されているわけではありません。すでにAndroid端末を使っていて、まずは無料で試したい方はGboardのRamblerから、記録の確実性や要約機能までまとめて求める方は専用デバイスから検討するとよいでしょう。
よくある質問(FAQ)
Q1. Gemini 3.5 TranscribeはiPhoneでも使えますか?
2026年8月末時点の情報では、日本語での提供はAndroid版Gboardの「Rambler」機能が中心です。iOS版や他プロダクトへの展開時期については、公式サイトで最新情報をご確認ください。
Q2. 無料で使えますか?
Gboard経由での音声入力としての利用に、現時点で追加費用は案内されていません。ただし開発者向けAPIとしての利用には別途料金体系があります。最新の料金は公式サイトでご確認ください。
Q3. WER(単語誤り率)の数値はそのまま信じていいですか?
Google自身が「精密な音声対話に最も精密なモデル」と位置づけている一方、WERの数値はGoogleが選んで開示した計測結果であり、第三者による横並び検証ではありません。参考値として捉え、実際の音声で試すことをおすすめします。
Q4. 会議の録音データをそのまま文字起こしできますか?
録音済み音声の文字起こしは開発者向けの「Interactions API」で対応していますが、一般ユーザー向けのGboard経由では現状リアルタイムの音声入力が中心です。録音データをまとめて処理したい場合は、対応が進むまで既存の文字起こしツールやAIボイスレコーダーと併用するのが現実的です。
まとめ
Gemini 3.5 Transcribeは、言い淀みを自動で整理してくれる点が実務での使い勝手に直結する新しい音声認識モデルです。2026年8月末時点では、日本語での一般提供はAndroid版Gboardの「Rambler」が中心で、Chrome・Docs・Gmailなどへの展開はこれからという段階になります。まずは普段の音声入力で精度を試しつつ、重要な会議やインタビューの記録には録音の確実性が高い専用デバイスを組み合わせるなど、用途に応じて使い分けていくのがおすすめです。






