📢
gitzw.com上线了,功能陆续更新中,如有问题或反馈请在下方反馈/建议中给我们留言。
✕
讀懂開源,從這裡開始
首頁
排行榜
教程中心
知識庫
資訊
分類
專題合集
🌙
繁
▾
简体
繁體
English
登入
使用者中心
▾
👤 使用者中心
📬 我的訂閱
✉️ 我的郵箱
🔑 修改密碼
⭐ 我的收藏
💬 我的回饋記錄
↩ 登出
訂閱
☰
首頁
排行榜
教程中心
知識庫
資訊
分類
專題合集
搜尋
訂閱
RSS
简体
繁體
English
🔍
搜尋
📡
RSS
🔥 熱門搜尋
llm
vuejs
pytorch
langchain
sql
graphql
peg
leetcode
tokio
redis
unity
php8
"語音處理"
espnet
/
espnet
espnet:端到端语音处理工具包 — espnet是一个端到端的语音处理工具包,使用Python语言开发,支持多种深度学习框架,如chainer和pytorch。它提供了多种语音处理功能,包括语音识别、语音合成、语音增强等。espnet的主要目标是提供一个高效、灵活的语音处理平台,用于研究和开发各种语音处理应用
Python
★ 9.9k
⑂ 2.4k
ai-ml
☆
RVC-Project
/
Retrieval-based-Voice-Conversion-WebUI
Retrieval-based-Voice-Conversion-WebUI:語音轉換網頁界面 — Retrieval-based-Voice-Conversion-WebUI 提供了一個簡單的網頁界面,讓用戶可以輕鬆地訓練語音轉換模型,無需大量的語音數據。這個工具利用了 Retrieval 模型和 VITS 等技術,實現了高質量的語音轉換。通過這個工具,用戶可以快速地建立自己的語音轉換模型,適用於各種語音應用
Python
★ 36.5k
⑂ 5.1k
data
☆
togatoga
/
karukan
karukan:Linux、macOS 的日語輸入法系統 — karukan 是一個開源的日語輸入法系統,適用於 Linux 和 macOS 平台。它使用神經網路技術實現假名漢字轉換,提供高效和準確的輸入體驗。karukan 的開發使用 Rust 語言,保證了系統的穩定性和安全性
Rust
★ 623
⑂ 38
ai-ml
+42 ★
☆
coqui-ai
/
TTS
TTS:文字轉語音工具包 — TTS 是一個基於 Python 的深度學習工具包,提供了多種文字轉語音的模型和技術,包括 Glow-TTS、HiFiGAN 和 MelGAN 等,能夠用於研究和生產環境。TTS 的優點在於其高質量的語音合成和靈活的配置選項。TTS 的應用包括語音合成、語音轉換和語音克隆等領域
Python
★ 45.8k
⑂ 6.2k
ai-ml
☆
AudioKit
/
AudioKit
AudioKit:音頻合成和分析平台 — AudioKit是一個開源的音頻合成、處理和分析平台,提供了一系列強大的API,讓開發者可以輕鬆地創建和操作音頻內容。它支援多種音頻格式和協議,包括MIDI,讓開發者可以創建出豐富多樣的音頻體驗。通過使用AudioKit,開發者可以打造出高品質的音頻應用,滿足不同用戶的需求
Swift
★ 11.4k
⑂ 1.6k
mobile
☆
FunAudioLLM
/
CosyVoice
CosyVoice:多語音頻生成模型 — CosyVoice是一個基於Python的多語音頻生成模型,能夠提供多種語言的音頻生成,包括英文、中文、日文和韓文等。它提供了推理、訓練和部署的全棧能力,讓用戶可以輕鬆地使用和擴展模型。CosyVoice的出現對於自然語言生成和文本轉語音等領域具有重要意義
Python
★ 22.1k
⑂ 2.6k
ai-ml
☆
jiaaro
/
pydub
pydub:音頻編輯庫 — pydub 能夠讓開發者輕鬆地操控音頻,包括剪輯、合併和修改音頻等。這個庫的高級介面使得音頻編輯變得非常簡單,讓開發者可以專注於其他工作。pydub 的優點在於其簡單易用,讓開發者可以快速地完成音頻編輯任務
Python
★ 9.8k
⑂ 1.1k
other
☆
CorentinJ
/
Real-Time-Voice-Cloning
Real-Time-Voice-Cloning:即時語音克隆技術 — Real-Time-Voice-Cloning 是一個基於 Python 的開源項目,利用 deep-learning 和 TTS 技術實現即時語音克隆。這個項目可以快速生成任意語音內容,對語音合成和語音識別領域具有重要意義。它支持多種框架,包括 PyTorch 和 TensorFlow
Python
★ 60k
⑂ 9.4k
ai-ml
☆
babysor
/
MockingBird
MockingBird:實時語音合成 — MockingBird 利用 PyTorch 和深度學習技術,實現了快速和高質量的語音合成。這個工具可以用於各種應用,例如語音助手、播音等。它的出色性能和易用性使其成為語音合成領域的一個重要突破
Python
★ 36.9k
⑂ 5.2k
ai-ml
☆
browser-use
/
video-use
video-use:編輯視頻的代碼代理 — video-use 是一個 Python 專案,允許用戶使用編碼代理編輯視頻。它提供了一種新的方式來處理視頻編輯任務,讓用戶可以更容易地實現複雜的編輯功能。這個專案對於需要批量編輯視頻的用戶來說尤其有用
Python
★ 14.1k
⑂ 1.7k
ai-ml
+554 ★
☆
linyqh
/
NarratoAI
NarratoAI:AI視頻剪輯與解說 — NarratoAI是一個基於Python的開源項目,利用AI模型來實現一鍵式影片解說和剪輯。這個項目使用了moviepy和Gemini API等庫來處理影片,能夠大大簡化影片製作的過程。NarratoAI的出現對於需要快速製作影片的用戶來說具有重要意義
Python
★ 10k
⑂ 1.4k
ai-ml
☆
neurocyte
/
flow
flow:程式設計師的文字編輯器 — flow 是一個基於 Zig 語言的文字編輯器,提供流程控制和語言伺服器客戶端功能,支援樹狀結構解析和終端使用者介面。它使用 language-server-protocol 和 tree-sitter 等技術,提供高效的編輯體驗。flow 的開發使用 Zig 語言,提供高性能和安全的編輯環境
Zig
★ 2.1k
⑂ 113
tools
☆
snakers4
/
silero-vad
silero-vad:企業級語音活動檢測器 — silero-vad 是一個預訓練的企業級語音活動檢測器,基於 PyTorch 和 ONNX 技術。它能夠精確地識別語音活動,適用於語音命令、語音控制等場景。
Python
★ 9.6k
⑂ 804
ai-ml
☆
moonshine-ai
/
moonshine
moonshine:低延遲語音處理 — moonshine 提供低延遲的語音轉文字、意圖識別和文字轉語音功能,特别適合用於開發語音代理和用戶界面,提升用戶體驗。
C++
★ 10.1k
⑂ 526
ai-ml
+282 ★
☆
letoram
/
arcan
arcan:桌面引擎與多媒體框架 — arcan 是一個開源的桌面引擎和多媒體框架,提供了顯示伺服器、遊戲引擎和多媒體處理功能。它使用 Zig 語言開發,支援多個平台,包括 Linux、FreeBSD 和 OpenBSD。arcan 的目標是提供一個高效、靈活和可擴展的桌面引擎和多媒體框架,適用於各種應用場景。
Zig
★ 1.8k
⑂ 93
backend
☆
supertone-inc
/
supertonic
supertonic:輕量級、多語言、在設備上的文字轉語音系統 — supertonic 是一個基於 ONNX 的文字轉語音系統,能夠快速地在各種設備上運行,支持多種語言和平臺,包括 iOS、Android、Web 等。它使用 Swift 語言開發,能夠實現輕量級和高效的文字轉語音功能。supertonic 的出現對於語音合成和語音助手等領域具有重要意義
Swift
★ 13.4k
⑂ 1.4k
mobile
☆
handy-computer
/
transcribe.cpp
transcribe.cpp:語音轉文字工具 — transcribe.cpp 是一個基於 ggml 庫的語音轉文字工具,支援超過 16 種不同的模型家族。它能夠高效地將語音轉換為文字,適用於各種需要自動轉錄語音的場景。
C++
★ 1.4k
⑂ 35
other
+395 ★
☆
mozilla
/
DeepSpeech
DeepSpeech:開源語音識別引擎 — DeepSpeech是一個開源的嵌入式語音識別引擎,利用Deep Learning和TensorFlow等技術,能夠在各種設備上實時運行,提供高準確度的語音識別功能。這個項目對於各種語音應用有重要意義,包括語音助手、語音控制等。DeepSpeech的開源性質也使得其能夠被廣泛使用和修改。
C++
★ 26.8k
⑂ 4.1k
ai-ml
☆
jamiepine
/
voicebox
voicebox:開源人工智慧語音工作室 — voicebox 是一個基於 TypeScript 的開源項目,提供了一個完整的語音工作室解決方案,讓用戶可以輕鬆地複製、輸入和創建語音內容。這個項目的目的是提供一個開源的語音工作室,讓開發者可以自由地使用和擴展。voicebox 的出現對於語音技術的發展具有重要意義
TypeScript
★ 44.6k
⑂ 5.4k
ai-ml
+821 ★
☆
myshell-ai
/
OpenVoice
OpenVoice:即時語音複製技術 — OpenVoice 是一個利用 Python 開發的音頻基礎模型,能夠實現即時語音複製,為 text-to-speech 和 voice-clone 領域提供了新的解決方案。這個技術的出現對於語音合成和語音識別領域具有重要意義。OpenVoice 的 zero-shot-tts 能力使其在業界具有競爭力
Python
★ 37k
⑂ 4.1k
other
☆
microsoft
/
VibeVoice
VibeVoice:開源前沿語音AI — VibeVoice是一個開源的語音AI項目,使用Python語言開發,提供了一種新的語音交互方式。它利用AI技術來實現語音識別、語音合成等功能,為用戶提供更好的語音體驗。VibeVoice的開源性使得開發者可以自由地擴展和修改它
Python
★ 50k
⑂ 5.6k
ai-ml
☆
hankcs
/
HanLP
HanLP:下一代自然語言處理 — HanLP是一個強大的自然語言處理工具包,提供了分詞、詞性標注、命名實體識別、句法與語義依存分析、文檔分類等功能。它的目的是為了簡化自然語言處理任務,讓開發者能夠更容易地構建自己的NLP應用。HanLP的出現對於NLP領域的發展具有重要意義
Python
★ 36.5k
⑂ 10.9k
ai-ml
☆
KoljaB
/
RealtimeSTT
RealtimeSTT:即時語音轉文字庫 — RealtimeSTT是一個基於Python的語音轉文字庫,提供即時的語音轉文字功能,具有低延遲和高準確度。它的先進語音活動檢測和喚醒詞激活功能,使其成為一個強大且實用的工具。RealtimeSTT的應用包括語音助手、語音控制和語音轉文字等領域
Python
★ 10k
⑂ 850
other
☆
heygen-com
/
hyperframes
hyperframes:用於AI和視頻渲染的框架 — hyperframes是一個強大的框架,允許用戶使用HTML和TypeScript來渲染視頻,同時支持AI代理的應用。它整合了ffmpeg、gsap和puppeteer等庫,提供了高效的渲染功能。hyperframes的出現為AI和視頻渲染領域帶來了新的可能性
TypeScript
★ 36.3k
⑂ 3.4k
ai-ml
☆
MiniMax-AI
/
skills
skills:人工智慧技能開發 — skills是一個開源項目,提供了一個基於C#的技能開發框架,讓開發者可以輕鬆地創建和集成人工智慧技能。這個項目的目的是提供一個簡單和靈活的方式來開發和應用人工智慧技能。同時,skills也提供了一個強大的API,讓開發者可以輕鬆地擴展和自定義技能
C#
★ 13.1k
⑂ 1.1k
other
☆
2noise
/
ChatTTS
ChatTTS:每日對話的生成語音模型 — ChatTTS是一個開源項目,使用Python和Torch等庫來實現生成語音模型。它可以用於每日對話的語音合成,提供自然和流暢的語音體驗。這個項目對於語音助手、聊天機器人等領域具有重要意義
Python
★ 39.7k
⑂ 4.2k
ai-ml
☆
m87-labs
/
moondream
moondream:微型視覺語言模型 — moondream 是一個基於 Python 的微型視覺語言模型,利用深度學習技術實現視覺和語言之間的交互。這個模型可以用於各種應用,例如圖像描述、視覺問答等。moondream 的開發對於推動人工智慧和機器學習的發展具有重要意義
Python
★ 9.9k
⑂ 789
other
☆
andrewyng
/
context-hub
context-hub:內容集線器 — context-hub 是一個開源的 JavaScript 專案,旨在提供內容管理和集線功能,讓開發者能夠更容易地管理和整合不同的內容來源。這個專案使用 JavaScript 開發,提供了一個靈活和可擴展的解決方案,讓開發者能夠根據自己的需求進行自訂。同時,context-hub 也提供了一個強大的 API,讓開發者能夠更容易地與其他應用程式和服務進行整合
JavaScript
★ 13.8k
⑂ 1.2k
web
☆
github-linguist
/
linguist
linguist:語言分析工具 — linguist 是一個開源工具,使用 Ruby 開發,能夠分析程式碼的語言並提供語言統計和語法分析。它的功能包括語言識別、語法高亮和語言統計等。linguist 的目的是為開發者提供一個準確的語言分析工具,以便於程式碼的管理和維護
Ruby
★ 13.6k
⑂ 5.3k
backend
☆
facefusion
/
facefusion
facefusion:人臉操控平台 — facefusion 是一個基於 Python 的人臉操控平台,提供業界領先的技術和功能。它可以用於創建逼真的面部動畫和特效,廣泛應用於電影、遊戲和廣告等領域。facefusion 的出色表現使其成為人臉操控的首選平台
Python
★ 29.3k
⑂ 4.8k
ai-ml
☆
explosion
/
spaCy
spaCy:工業級自然語言處理 — spaCy 提供高效的自然語言處理功能,包括實體辨識、文本分類和標記化等,能夠有效地處理大量文本數據。它的優點在於高效、可擴展和易於使用,廣泛應用於各個領域的文本分析任務。因此,spaCy 成為了 Python 中最受歡迎的 NLP 庫之一
Python
★ 33.8k
⑂ 4.7k
ai-ml
☆
open-mmlab
/
Amphion
Amphion:音頻、音樂和語音生成工具包 — Amphion是一個基於Python的工具包,提供了一系列的音頻、音樂和語音生成功能,包括音頻合成、音樂生成、語音合成等。它的目的是支持可重現的研究和幫助初級研究人員和工程師入門音頻、音樂和語音生成研究和開發領域。通過使用Amphion,研究人員和工程師可以快速地開發和測試自己的音頻、音樂和語音生成模型。
Python
★ 10k
⑂ 829
other
☆
chenfei-wu
/
TaskMatrix
TaskMatrix:任務管理工具 — TaskMatrix 是一個開源的任務管理工具,使用 Python 編寫。它提供了一個簡單易用的介面來管理和追蹤任務,讓用戶可以輕鬆地組織和優先處理任務。透過 TaskMatrix,用戶可以提高工作效率和生產力。
Python
★ 34.1k
⑂ 3.2k
other
☆
interviewstreet
/
hiring-agent
hiring-agent:人工智慧招聘評估代理 — hiring-agent 是一個人工智慧代理,利用 AI 技術評估和評分簡歷,以幫助企業快速找到合適的候選人。這個代理可以自動化招聘流程,節省時間和成本。同時,hiring-agent 也可以提供更客觀和公平的評估結果
Python
★ 2.5k
⑂ 623
ai-ml
+203 ★
☆
kaldi-asr
/
kaldi
kaldi:語音識別開源專案 — kaldi 是一個開源的語音識別軟體工具包,提供了一系列的語音處理和識別功能,包括語音轉文字、語音辨識和聲音驗證等。它使用 C++ 和 CUDA 等技術實現,廣泛應用於語音助手、語音搜索和語音控制等領域。kaldi 的開源性使得開發者可以自由修改和擴展其功能
Shell
★ 15.4k
⑂ 5.4k
other
☆