4050億參數！Meta或將7月23日釋出迄今最強大Llama 3模型

2024-07-13科技

來源：媒體捲動

來源：硬AI

不到兩周後，我們可能就會見到迄今為止最強大的開源Llama 3模型。

美東時間7月12日周五，媒體援引一名Meta Platforms的員工訊息稱，Meta計劃7月23日釋出旗下第三代大語言模型（LLM）Llama 3的最大版本。這一最新版模型將擁有4050億參數，也將是多模態模型，這意味著它將能夠理解和生成影像和文本。該媒體未透露這一最強版本是否開源。

Meta公司拒絕對上述訊息置評。周五盤中，低開的Meta股價跌幅收窄，盤初曾跌3.6%，午盤跌不足2%，仍將在周四大幅回落超4%後連跌兩日，或將重新整理6月28日以來收盤低位。

去年7月Meta釋出的Llama 2有三個版本，最大版本70B的參數規模為700億。今年4月，Meta釋出Llama 3Meta，稱它為「迄今為止能力最強的開源LLM」。當時推出的Llama 3有8B和70B兩個版本。

Meta CEO祖克柏當時稱，大版本的Llama 3將有超過4000億參數。Meta並未透露會不會將4000億參數規模的Llama 3開源，當時它還在接受訓練。

對比前代，Llama 3有了質的飛躍。Llama 2使用2萬億個 token進行訓練，而訓練Llama 3大版本的token超過15 萬億。

Meta稱，由於預訓練和訓練後的改進，其預訓練和指令調優的模型是目前8B和70B兩個參數規模的最佳模型。在訓練後程式得到改進後，模型的錯誤拒絕率（FRR）大幅下降，一致性提高，模型響應的多樣性增加。在推理、程式碼生成和指令跟蹤等功能方面，Llama 3相比Llama 2有極大改進，使Llama 3更易於操控。

4月Meta展示，8B和70B版本的Llama 3指令調優模型在大規模多工語言理解數據集（MMLU）、研究生水平專家推理（GPQA）、數學評測集（GSM8K）、編程多語言測試（HumanEval）等方面的測評得分都高於Mistral、谷歌的Gemma和Gemini和Anthropic的Claude 3。8B和70B版本的預訓練Llama 3多種效能測評優於Mistral、Gemma、Gemini和Mixtral。

當時社交媒體的網友評論稱，根據基準測試，當前的Llama 3模型不完全是 GPT-4 級別的，但仍在訓練中的較大尺寸的模型將達到 GPT-4 級別。