Hume AI開源TADA語音生成模型,採用文本-聲學雙對齊架構,顯著提升TTS系統效率與可靠性。通過實現文本token與聲學表示1:1嚴格同步,有效解決了傳統LLM-based TTS中的內容幻覺問題。經超千個樣本測試驗證,模型表現優異。
瞳行科技推出國內首款AI助盲眼鏡,集成阿里通義千問大模型,爲視障人士提供實時出行輔助。產品由眼鏡、手機、遙控指環和盲杖協同工作,通過雙攝像頭實現300毫秒低延遲路況播報,支持識別公交牌、路標及環境概述。技術總監陳剛表示,大模型壓縮70%研發成本,加速算法落地。眼鏡還具備本地文本識別功能。
Meta首席AI科學家楊立昆離職後首次公開表示,大公司重金投入大型語言模型是戰略錯誤,無法實現真正智能。他指出LLM僅能統計補全文本,缺乏物理世界理解、長期推理和規劃能力,註定無法達到人類智能水平。他認爲下一代突破應依靠“世界模型”。
騰訊優圖實驗室開源Youtu-Embedding文本表示模型,提升企業智能客服和知識庫管理效率。該模型通過精確信息提取,避免大模型在特定領域生成誤導性答案,解決通用語料導致的不相關回復問題,有效應對跨領域表現不佳現象。
利用GPT-3模型將非結構化文本數據轉換為結構化知識圖譜表示
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$6
$24
256
$4
$16
Baidu
128
Bytedance
$1.2
$3.6
4
$2
nvidia
NVIDIA Nemotron Parse v1.1 是一款先進的文檔解析模型,專門用於理解文檔語義並提取具有空間定位的文本和表格元素。它能夠將非結構化文檔轉換為機器可讀的結構化表示,克服了傳統OCR在處理複雜文檔佈局時的侷限性。
Tarka-AIR
Tarka-Embedding-350M-V1是一個擁有3.5億參數的文本嵌入模型,能夠生成1024維的密集文本表示。該模型針對語義相似性、搜索和檢索增強生成(RAG)等下游應用進行了優化,支持多種語言並具有長上下文處理能力。
Tarka-Embedding-150M-V1是一個具有1.5億參數的嵌入模型,可生成768維的密集文本表示。它針對語義相似性、搜索和檢索增強生成(RAG)等多種下游應用進行了優化,專注於捕捉深層上下文語義,以支持跨不同領域的通用文本理解。
ShantanuT01
基於BERT-tiny架構的輕量級AI生成文本檢測模型,專門用於從RAID數據集中識別AI生成的文本內容。模型輸出分數表示文本是人類生成的可能性。
MagicalAlchemist
BGE-M3是由BAAI開發的多功能文本嵌入模型,支持多語言、多粒度、多功能的文本表示學習,能夠同時處理稠密檢索、稀疏檢索和多向量檢索等多種檢索模式。
mlx-community
EmbeddingGemma 300M 4bit是Google開發的輕量級文本嵌入模型,專門針對MLX框架優化。該模型能夠將文本轉換為高質量的向量表示,適用於各種自然語言處理任務,特別是句子相似度計算和特徵提取。
csuhan
通過文本對齊表示實現視覺理解與生成的統一模型
GeoGPT-Research-Project
GeoEmbedding是一款專為地球科學領域設計的文本嵌入模型,基於高性能大語言模型構建,能夠為地球科學文本生成準確且具有上下文感知能力的向量表示。
Leo1212
這是一個基於allenai/longformer-base-4096微調的sentence-transformers模型,用於生成句子和段落的768維密集向量表示,適用於語義文本相似度、語義搜索等任務。
Tevatron
基於Qwen2.5-Omni-7B構建的多模態嵌入模型,支持跨語言文本、圖像、音頻和視頻的統一嵌入表示
yuriyvnv
BGE-m3是一款專為法律應用定製的特定領域文本嵌入模型,能夠將法律文檔、句子和查詢轉換為密集向量表示,精準捕捉法律語言中的細微語義關係。
DeepMostInnovations
專為印地語文本訓練的自定義前沿句子嵌入模型,採用先進的Transformer架構與專用池化策略,可生成高質量的印地語句子語義表示。
zhibinlan
LLaVE-7B是基於LLaVA-OneVision-7B模型的70億參數多模態嵌入模型,具備文本、圖像、多圖像和視頻的嵌入表示能力。
LLaVE-2B是基於Aquila-VL-2B模型的20億參數多模態嵌入模型,具有4K tokens的上下文窗口,支持文本、圖像、多圖像和視頻的嵌入表示。
vidore
基於Qwen2.5-VL-3B-Instruct與ColBERT策略的視覺檢索模型,能夠生成文本和圖像的多向量表示,用於高效文檔檢索。
KenLi315
Conan-embedding-v1 是由騰訊BAC團隊開發的中文文本嵌入模型,專注於中文文本的語義表示和相似度計算。
tsystems
基於Qwen2-VL-2B-Instruct與ColBERT策略的視覺檢索模型,能夠生成多向量文本與圖像表示
yydxlv
基於Qwen2-VL-7B-Instruct與ColBERT策略的視覺檢索模型,支持多向量文本與圖像表示
ntphuc149
ViLegalBERT是一個專門針對越南法律文本優化的預訓練語言模型,通過在大量越南法律語料庫上對PhoBERT-base-v2進行持續預訓練而開發。該模型具備1.35億參數,專注于越南法律術語和概念的理解,為法律領域的各種NLP任務提供高質量的上下文表示。
mertcobanov
這是一個基於microsoft/mpnet-base微調的sentence-transformers模型,用於句子和段落的向量表示,支持語義文本相似度等任務。