Transcript


Paper/Blog Link My Issue
#Multi #NLP #SpeechProcessing #AudioLanguageModel #Author Thread-Post Issue Date: 2026-07-19 GPT Summary- SATSは話者の発話内容とタイミングを記録する技術で、特に会議の議事録作成に役立ちますが、既存のシステムは限界があります。この問題に対処するため、MOSS Transcribe Diarizeという多機能な大規模言語モデルを提案し、エンドツーエンドでの話者帰属と時刻付き転写を実現します。最大90分の入力に対応する128kのコンテキストウィンドウを持ち、商用システムを上回る性能を評価で示しました。 Comment

元ポスト:

Loading…

話者分離可能な書き起こしモデル




Paper/Blog Link My Issue
#Article #LanguageModel #AIAgents #TextToImageGeneration #Blog #Coding #Proprietary #TTS #ImageSynthesis #Author Thread-Post Issue Date: 2026-06-03 Comment

- MAI-Thinking-1: Building a Hill-Climbing Machine, Microsoft, 2026.06

元ポスト:

Loading…

関連:

Loading…

Artificial Analysisによる評価で、MAI Image-2.5がT2Iで2位, Image Editingが3位とのこと:

Loading…




Paper/Blog Link My Issue
#Article #SpeechProcessing #Blog #MultiLingual #OpenWeight #Proprietary #AutomaticSpeechRecognition(ASR) #Realtime Issue Date: 2026-02-05 Comment

元ポスト:

Loading…

Voxtral Mini Transcribe V2はproprietaryモデルでAPI利用のみ、Vostraal RealtimeはOpenWeightで公開
mistralai/Voxtral-Mini-4B-Realtime-2602: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602

Vostral Mini Transcrive V2に対するVoxtral Realtimeの性能の比較。Voxtral Realtimeは遅延を調整可能なようで、遅延が大きければ大きいほど高い性能が出るが、リアルタイムに近づけば近づくほど性能はその分劣化する。
image