Add flake.nix with portaudio + CUDA, microphone support in transcribe.py

2026-05-26 01:55:54 +08:00
parent 8b88489a53
commit 55a51a7668
2 changed files with 51 additions and 10 deletions
@@ -0,0 +1,21 @@
 {
  description = "Cohere Transcribe dev environment with microphone support";
  inputs = {
    nixpkgs.url = "github:NixOS/nixpkgs/nixpkgs-unstable";
  };
  outputs = { nixpkgs, ... }: {
    devShells.x86_64-linux.default = nixpkgs.legacyPackages.x86_64-linux.mkShell {
      buildInputs = with nixpkgs.legacyPackages.x86_64-linux; [
        portaudio
        cudaPackages.cudatoolkit
      ];
      shellHook = ''
        export LD_LIBRARY_PATH="${cudaPackages.cudatoolkit}/lib:$LD_LIBRARY_PATH"
        echo "Dev shell ready - microphone input enabled"
      '';
    };
  };
 }
@@ -1,3 +1,6 @@
 import sys
 import numpy as np
 import sounddevice as sd
 from transformers import AutoProcessor, CohereAsrForConditionalGeneration
 from transformers.audio_utils import load_audio
 from huggingface_hub import hf_hub_download
@@ -18,14 +21,31 @@ def transcribe_audio(audio, language="en"):
    text = processor.decode(outputs, skip_special_tokens=True)
    return text
-# Use demo audio file from Hugging Face
+def record_audio(duration, samplerate=16000):
-print("Loading demo audio...")
+    print(f"Recording for {duration} seconds...")
-audio_file = hf_hub_download(
+    audio = sd.rec(int(duration * samplerate), samplerate=samplerate, channels=1, dtype='float32')
    sd.wait()
    return audio.flatten()
 # Parse arguments
 if len(sys.argv) > 1 and sys.argv[1] == "--mic":
    duration = int(sys.argv[2]) if len(sys.argv) > 2 else 5
    try:
        mic_audio = record_audio(duration)
        print("Transcribing...")
        text = transcribe_audio(mic_audio)
        print(f"\nTranscription:\n{text}\n")
    except OSError as e:
        print(f"Microphone error: {e}")
        print("Hint: Run with nix-shell for PortAudio support")
 else:
    print("Loading demo audio...")
    audio_file = hf_hub_download(
        repo_id="CohereLabs/cohere-transcribe-03-2026",
        filename="demo/voxpopuli_test_en_demo.wav",
-)
+    )
-audio = load_audio(audio_file, sampling_rate=16000)
+    audio = load_audio(audio_file, sampling_rate=16000)
-print("Transcribing...")
+    print("Transcribing...")
-text = transcribe_audio(audio)
+    text = transcribe_audio(audio)
-print(f"\nTranscription:\n{text}\n")
+    print(f"\nTranscription:\n{text}\n")