📢
gitzw.com上线了,功能陆续更新中,如有问题或反馈请在下方反馈/建议中给我们留言。
✕
讀懂開源,從這裡開始
首頁
排行榜
教程中心
知識庫
資訊
分類
專題合集
🌙
繁
▾
简体
繁體
English
登入
使用者中心
▾
👤 使用者中心
📬 我的訂閱
✉️ 我的郵箱
🔑 修改密碼
⭐ 我的收藏
💬 我的回饋記錄
↩ 登出
訂閱
☰
首頁
排行榜
教程中心
知識庫
資訊
分類
專題合集
搜尋
訂閱
RSS
简体
繁體
English
🔍
搜尋
📡
RSS
🔥 熱門搜尋
llm
vuejs
pytorch
langchain
sql
graphql
peg
leetcode
tokio
redis
unity
php8
"語音轉文字"
espnet
/
espnet
espnet:端到端语音处理工具包 — espnet是一个端到端的语音处理工具包,使用Python语言开发,支持多种深度学习框架,如chainer和pytorch。它提供了多种语音处理功能,包括语音识别、语音合成、语音增强等。espnet的主要目标是提供一个高效、灵活的语音处理平台,用于研究和开发各种语音处理应用
Python
★ 9.9k
⑂ 2.4k
ai-ml
☆
moonshine-ai
/
moonshine
moonshine:低延遲語音處理 — moonshine 提供低延遲的語音轉文字、意圖識別和文字轉語音功能,特别適合用於開發語音代理和用戶界面,提升用戶體驗。
C++
★ 10.1k
⑂ 526
ai-ml
+282 ★
☆
RVC-Project
/
Retrieval-based-Voice-Conversion-WebUI
Retrieval-based-Voice-Conversion-WebUI:語音轉換網頁界面 — Retrieval-based-Voice-Conversion-WebUI 提供了一個簡單的網頁界面,讓用戶可以輕鬆地訓練語音轉換模型,無需大量的語音數據。這個工具利用了 Retrieval 模型和 VITS 等技術,實現了高質量的語音轉換。通過這個工具,用戶可以快速地建立自己的語音轉換模型,適用於各種語音應用
Python
★ 36.5k
⑂ 5.1k
data
☆
supertone-inc
/
supertonic
supertonic:輕量級、多語言、在設備上的文字轉語音系統 — supertonic 是一個基於 ONNX 的文字轉語音系統,能夠快速地在各種設備上運行,支持多種語言和平臺,包括 iOS、Android、Web 等。它使用 Swift 語言開發,能夠實現輕量級和高效的文字轉語音功能。supertonic 的出現對於語音合成和語音助手等領域具有重要意義
Swift
★ 13.4k
⑂ 1.4k
mobile
☆
jiaaro
/
pydub
pydub:音頻編輯庫 — pydub 能夠讓開發者輕鬆地操控音頻,包括剪輯、合併和修改音頻等。這個庫的高級介面使得音頻編輯變得非常簡單,讓開發者可以專注於其他工作。pydub 的優點在於其簡單易用,讓開發者可以快速地完成音頻編輯任務
Python
★ 9.8k
⑂ 1.1k
other
☆
KoljaB
/
RealtimeSTT
RealtimeSTT:即時語音轉文字庫 — RealtimeSTT是一個基於Python的語音轉文字庫,提供即時的語音轉文字功能,具有低延遲和高準確度。它的先進語音活動檢測和喚醒詞激活功能,使其成為一個強大且實用的工具。RealtimeSTT的應用包括語音助手、語音控制和語音轉文字等領域
Python
★ 10k
⑂ 850
other
☆
cjpais
/
Handy
Handy:離線語音轉文字應用程式 — Handy是一個基於Rust開發的語音轉文字應用程式,能夠完全離線運作,提供跨平台的語音轉文字功能。它的開源和可擴充性使其成為一個非常有潛力的語音轉文字解決方案。Handy的出現對於需要離線語音轉文字的用戶來說是一個福音。
Rust
★ 26.9k
⑂ 2.3k
other
☆
coqui-ai
/
TTS
TTS:文字轉語音工具包 — TTS 是一個基於 Python 的深度學習工具包,提供了多種文字轉語音的模型和技術,包括 Glow-TTS、HiFiGAN 和 MelGAN 等,能夠用於研究和生產環境。TTS 的優點在於其高質量的語音合成和靈活的配置選項。TTS 的應用包括語音合成、語音轉換和語音克隆等領域
Python
★ 45.8k
⑂ 6.2k
ai-ml
☆
togatoga
/
karukan
karukan:Linux、macOS 的日語輸入法系統 — karukan 是一個開源的日語輸入法系統,適用於 Linux 和 macOS 平台。它使用神經網路技術實現假名漢字轉換,提供高效和準確的輸入體驗。karukan 的開發使用 Rust 語言,保證了系統的穩定性和安全性
Rust
★ 623
⑂ 38
ai-ml
+42 ★
☆
2noise
/
ChatTTS
ChatTTS:每日對話的生成語音模型 — ChatTTS是一個開源項目,使用Python和Torch等庫來實現生成語音模型。它可以用於每日對話的語音合成,提供自然和流暢的語音體驗。這個項目對於語音助手、聊天機器人等領域具有重要意義
Python
★ 39.7k
⑂ 4.2k
ai-ml
☆
babysor
/
MockingBird
MockingBird:實時語音合成 — MockingBird 利用 PyTorch 和深度學習技術,實現了快速和高質量的語音合成。這個工具可以用於各種應用,例如語音助手、播音等。它的出色性能和易用性使其成為語音合成領域的一個重要突破
Python
★ 36.9k
⑂ 5.2k
ai-ml
☆
myshell-ai
/
OpenVoice
OpenVoice:即時語音複製技術 — OpenVoice 是一個利用 Python 開發的音頻基礎模型,能夠實現即時語音複製,為 text-to-speech 和 voice-clone 領域提供了新的解決方案。這個技術的出現對於語音合成和語音識別領域具有重要意義。OpenVoice 的 zero-shot-tts 能力使其在業界具有競爭力
Python
★ 37k
⑂ 4.1k
other
☆
JaidedAI
/
EasyOCR
EasyOCR:支援80多種語言的OCR解決方案 — EasyOCR是一個基於Python的OCR解決方案,利用深度學習技術來識別圖像中的文字,支援多種語言和書寫系統。它可以應用於多種領域,如數據挖掘、圖像處理和信息檢索。EasyOCR的出色性能和易用性使其成為開發人員的首選
Python
★ 29.8k
⑂ 3.6k
ai-ml
☆
FunAudioLLM
/
CosyVoice
CosyVoice:多語音頻生成模型 — CosyVoice是一個基於Python的多語音頻生成模型,能夠提供多種語言的音頻生成,包括英文、中文、日文和韓文等。它提供了推理、訓練和部署的全棧能力,讓用戶可以輕鬆地使用和擴展模型。CosyVoice的出現對於自然語言生成和文本轉語音等領域具有重要意義
Python
★ 22.1k
⑂ 2.6k
ai-ml
☆
mozilla
/
DeepSpeech
DeepSpeech:開源語音識別引擎 — DeepSpeech是一個開源的嵌入式語音識別引擎,利用Deep Learning和TensorFlow等技術,能夠在各種設備上實時運行,提供高準確度的語音識別功能。這個項目對於各種語音應用有重要意義,包括語音助手、語音控制等。DeepSpeech的開源性質也使得其能夠被廣泛使用和修改。
C++
★ 26.8k
⑂ 4.1k
ai-ml
☆
CorentinJ
/
Real-Time-Voice-Cloning
Real-Time-Voice-Cloning:即時語音克隆技術 — Real-Time-Voice-Cloning 是一個基於 Python 的開源項目,利用 deep-learning 和 TTS 技術實現即時語音克隆。這個項目可以快速生成任意語音內容,對語音合成和語音識別領域具有重要意義。它支持多種框架,包括 PyTorch 和 TensorFlow
Python
★ 60k
⑂ 9.4k
ai-ml
☆
handy-computer
/
transcribe.cpp
transcribe.cpp:語音轉文字工具 — transcribe.cpp 是一個基於 ggml 庫的語音轉文字工具,支援超過 16 種不同的模型家族。它能夠高效地將語音轉換為文字,適用於各種需要自動轉錄語音的場景。
C++
★ 1.4k
⑂ 35
other
+395 ★
☆
jamiepine
/
voicebox
voicebox:開源人工智慧語音工作室 — voicebox 是一個基於 TypeScript 的開源項目,提供了一個完整的語音工作室解決方案,讓用戶可以輕鬆地複製、輸入和創建語音內容。這個項目的目的是提供一個開源的語音工作室,讓開發者可以自由地使用和擴展。voicebox 的出現對於語音技術的發展具有重要意義
TypeScript
★ 45.6k
⑂ 5.6k
ai-ml
+565 ★
☆
neurocyte
/
flow
flow:程式設計師的文字編輯器 — flow 是一個基於 Zig 語言的文字編輯器,提供流程控制和語言伺服器客戶端功能,支援樹狀結構解析和終端使用者介面。它使用 language-server-protocol 和 tree-sitter 等技術,提供高效的編輯體驗。flow 的開發使用 Zig 語言,提供高性能和安全的編輯環境
Zig
★ 2.1k
⑂ 113
tools
☆
zesterer
/
chumsky
chumsky:簡單高效的解析器 — chumsky 允許用戶以簡潔的方式編寫解析器,支援上下文無關文法、錯誤處理和 lexical 分析等功能。它使用解析器組合子和遞歸下降解析等技術,實現了高性能的解析。chumsky 的設計目標是簡單易用,讓用戶能夠輕鬆地構建複雜的解析器
Rust
★ 4.5k
⑂ 210
other
☆
linyqh
/
NarratoAI
NarratoAI:AI視頻剪輯與解說 — NarratoAI是一個基於Python的開源項目,利用AI模型來實現一鍵式影片解說和剪輯。這個項目使用了moviepy和Gemini API等庫來處理影片,能夠大大簡化影片製作的過程。NarratoAI的出現對於需要快速製作影片的用戶來說具有重要意義
Python
★ 10k
⑂ 1.4k
ai-ml
☆
rough-stuff
/
rough-notation
rough-notation:在網頁上創建和動畫手繪註釋 — rough-notation 是一個基於 TypeScript 的庫,允許開發者在網頁上創建和動畫手繪註釋。它提供了一個簡單的 API,用於定義和自訂註釋的外觀和動畫。這個庫對於需要在網頁上添加註釋和強調的開發者來說非常有用
TypeScript
★ 9.6k
⑂ 237
web
☆
huggingface
/
transformers
transformers:機器學習模型框架 — transformers 提供了一個統一的框架,讓開發者可以輕鬆地使用和訓練各種機器學習模型,包括自然語言處理、語音識別和視覺模型等。這個框架支持 PyTorch 和其他深度學習庫,讓開發者可以快速地部署和集成模型。同時,transformers 還提供了大量的預訓練模型,讓開發者可以快速地開始自己的項目。
Python
★ 162.7k
⑂ 33.9k
ai-ml
☆
nextai-translator
/
nextai-translator
nextai-translator:基於 ChatGPT API 的翻譯工具 — nextai-translator 可以幫助用戶快速翻譯網頁內容,支援多種瀏覽器和桌面端平台。它基於 ChatGPT API,能夠提供高質量的翻譯結果。這個工具對於需要頻繁翻譯內容的用戶來說非常有用
TypeScript
★ 24.9k
⑂ 1.8k
ai-ml
☆
PaddlePaddle
/
PaddleOCR
PaddleOCR:強大的輕量級OCR工具包 — PaddleOCR是一個強大的輕量級OCR工具包,能夠橋接圖像/PDF和LLM之間的鴻溝。它支持100多種語言,能夠將任何PDF或圖像文檔轉換為結構化數據,為AI應用提供了強大的支持。這使得PaddleOCR成為文檔解析和文檔翻譯的重要工具
Python
★ 85.8k
⑂ 11k
ai-ml
☆
tisfeng
/
Easydict
Easydict:简洁优雅的词典翻译macOS App — Easydict是一个简洁优雅的词典翻译macOS App,支持离线OCR识别和多家翻译服务,如有道词典、Google、Bing、DeepL等。它可以帮助用户快速翻译文本和查找单词,支持多种翻译服务,包括OpenAI、Gemini等。Easydict的离线OCR识别功能使其即使在没有网络连接的情况下也能正常工作
Swift
★ 13.9k
⑂ 701
mobile
☆
heygen-com
/
hyperframes
hyperframes:用於AI和視頻渲染的框架 — hyperframes是一個強大的框架,允許用戶使用HTML和TypeScript來渲染視頻,同時支持AI代理的應用。它整合了ffmpeg、gsap和puppeteer等庫,提供了高效的渲染功能。hyperframes的出現為AI和視頻渲染領域帶來了新的可能性
TypeScript
★ 36.3k
⑂ 3.4k
ai-ml
☆
vercel-labs
/
portless
portless:穩定命名的本地URL替代端口號碼 — portless是一個開源工具,允許開發人員使用穩定命名的本地URL來訪問應用程式,減少了端口號碼的複雜性和混亂。這個工具對於人類和代理程式都很有用,可以簡化開發流程和提高生產力。通過使用portless,開發人員可以更容易地管理和維護複雜的應用程式
TypeScript
★ 10k
⑂ 322
ai-ml
☆
datalab-to
/
marker
marker:快速PDF轉換工具 — marker是一個基於Python的工具,能夠快速將PDF檔轉換為markdown和JSON格式,具有高準確度。這個工具對於需要處理大量PDF檔的用戶來說非常有用。同時,marker的高準確度也能夠確保轉換後的檔案內容正確無誤
Python
★ 37.7k
⑂ 2.6k
other
☆
AUTOMATIC1111
/
stable-diffusion-webui
stable-diffusion-webui:基於網頁的穩定擴散模型界面 — stable-diffusion-webui是一個基於Python和Gradio的網頁應用,允許用戶使用Stable Diffusion模型進行圖像生成、圖像到圖像的轉換和文本到圖像的轉換。這個工具提供了一種簡單的方式來使用深度學習模型進行創意工作。同時,它也支持圖像的上采樣和編輯等功能
Python
★ 164.2k
⑂ 30.4k
ai-ml
☆
chenglou
/
pretext
pretext:快速、準確的文字測量和佈局 — pretext 能夠快速和準確地計算文字的尺寸和佈局,同時也提供了全面的文字測量功能。這個工具對於需要處理大量文字資料的開發人員來說非常重要。通過使用 pretext,開發人員可以更好地控制文字的顯示和排版
TypeScript
★ 49.2k
⑂ 2.7k
web
☆
mozilla-ai
/
llamafile
llamafile:以單一檔案分佈和運行大型語言模型 — llamafile 的主要功能是將大型語言模型打包成單一檔案,讓用戶可以輕鬆地在不同平台上分佈和運行。這個功能對於開發人員和用戶來說非常重要,因為它可以簡化大型語言模型的部署和運行過程。同時,llamafile 也支持跨平台和本地推理等功能,讓用戶可以更靈活地使用大型語言模型。
C++
★ 25.4k
⑂ 1.5k
ai-ml
☆
kaldi-asr
/
kaldi
kaldi:語音識別開源專案 — kaldi 是一個開源的語音識別軟體工具包,提供了一系列的語音處理和識別功能,包括語音轉文字、語音辨識和聲音驗證等。它使用 C++ 和 CUDA 等技術實現,廣泛應用於語音助手、語音搜索和語音控制等領域。kaldi 的開源性使得開發者可以自由修改和擴展其功能
Shell
★ 15.4k
⑂ 5.4k
other
☆