Nova Patents
EP0865026A2

Method for modifying speech speed

Abstract

The modification method has an analogue speech signal converted into a corresponding digital signal. The digital signal is entered in a memory, with lengthening or shortening of the signal by a pre-defined factor, using an add overlap method. The stored speech signal is divided into segments which are weighted via a window function with a first rising section, a constant section and a falling section. There is a comparison made of the weighted segments, for waveform similarity and addition of the segments, when the similarity has a maximum value.

EP0865026A2, drawing sheet 1
Sheet 1 of 9

Term

Term ended

Projected expiry passed 12 March 2018, 8.5 years ago.

  1. Priority
  2. Filed
  3. Published
  4. Projected expiry
  5. Today

2 claims: 2 independent, 0 dependent

  1. 1
    Method for speed modification of speech signals, in particular digitized speech signals, in whichan analog speech signal is digitized, resulting in a digitized speech signal which is stored in a memory,a factor α is defined by which the speech signal is lengthened or shortened,- A window function is defined with a first rising section of length N, a second, constant section of length L directly adjoining the first section and a third falling section directly adjoining the second section, with a superposition of the first rising section of a window with the third falling section of another window and an addition of both sections in the overlap area, the result is one, which corresponds to the value of the second section of the window function,segments of a length L + N are taken from the digitized, stored speech signal at irregular intervals of an average length αL,- These segments, taken from the digitized, stored speech signal, are weighted with the window function in the time domainthe weighted segments are each added up offset by a defined number of L samples, as a result of which the resulting speech signal is extended by the factor α or shortened by 1 / α,characterized,that, at the points at which the segments are extracted from the digitized speech signal, the segment extracted there, weighted with the window function, is compared with the segment subsequently extracted, also weighted with the window function, under similarity aspects,that for a quick comparison of the similarity of the segments, only the third section of the segment, weighted with the falling window section, is compared with the first section of the following segment, weighted with the increasing N section window section,- That these segments are added to each other offset when the similarity of the two compared segments is maximum and- That a correlation is used to calculate the similarity, as its measure. Verfahren zur Geschwindigkeitsmodifikation von Sprachsignalen, insbesondere digitalisierten Sprachsignalen, bei dem - ein analoges Sprachsignal digitalisiert wird, wodurch ein digitalisiertes Sprachsignal entsteht, welches in einem Speicher gespeichert wird,- ein Faktor α definiert wird, um welchen das Sprachsignal verlängert oder verkürzt wird,- eine Fensterfunktion mit einem ersten steigenden Abschnitt der Länge N, einem zweiten, sich direkt an den ersten Abschnitt anschließenden, konstanten Abschnitt der Länge L und einem dritten, sich direkt an den zweiten Abschnitt anschließenden, fallenden Abschnitt definiert wird, wobei bei einer Überlagerung des ersten steigenden Abschnittes eines Fensters mit dem dritten fallenden Abschnitt eines anderen Fensters und einer Addition beider Abschnitte im Überlappungsbereich, sich das Ergebnis eins ergibt, was dem Wert des zweiten Abschnittes der Fensterfunktion entspricht,- aus dem digitalisierten, gespeicherten Sprachsignal in unregelmäßigen Abständen einer mittleren Länge αL Segmente einer Länge L+N entnommen werden,- diese, aus dem digitalisierten, gespeicherten Sprachsignal entnommenen, Segmente mit der Fensterfunktion im Zeitbereich gewichtet werden- die gewichteten Segmente jeweils um eine definierte Anzahl von L Abtastwerten versetzt aufaddiert werden, wodurch das so entstehende Sprachsignal um den Faktor α verlängert bzw. um 1/α verkürzt wird, dadurch gekennzeichnet,- daß nacheinander an den Stellen der Entnahme der Segmente aus dem digitalisierten Sprachsignal, das dort entnommene, mit der Fensterfunktion gewichtete, Segment mit dem nachfolgend entnommenen, ebenfalls mit der Fensterfunktion gewichteten, Segment unter Ähnlichkeitsaspekten verglichen wird,- daß zum schnellen Vergleich der Ähnlichkeit der Segmente lediglich der N Werte lange dritte, mit dem fallenden Fensterabschnitt gewichtete, Abschnitt des Segmentes mit dem jeweils ersten, mit dem steigenden N Werte langen Fensterabschnitt gewichteten Abschnitten des nachfolgenden Segmentes verglichen wird,- daß diese Segmente zueinander versetzt aufaddiert werden, wenn die Ähnlichkeit beider verglichener Segmentteile maximal ist und- daß zur Berechnung der Ähnlichkeit, als deren Maß, eine Korrelation verwendet wird.
  2. 2
    Method for speed modification of speech signals, in particular digitized speech signals, in whichan analog speech signal is digitized, resulting in a digitized speech signal which is stored in a memory,a factor α is defined by which the speech signal is lengthened or shortened,- A window function is defined with a first rising section of length N, a second, constant section of length L directly adjoining the first section and a third falling section directly adjoining the second section, with a superposition of the first rising section of a window with the third falling section of another window and an addition of both sections in the overlap area, the result is one, which corresponds to the value of the second section of the window function,segments of a length L + N are taken from the digitized, stored speech signal at irregular intervals of an average length αL,these segments, taken from the digitized, stored speech signal, are weighted with the window function in the time domain,the weighted segments are each added up offset by a defined number of L samples, as a result of which the resulting speech signal is extended by the factor α or shortened by 1 / α,characterized,that, at the points where the segments are removed from the digitized speech signal, the segment extracted there is compared with the result of the synthesis with the segment subsequently extracted,that for the quick comparison of the deviation of the respective synthesis result from the original signal, only the N section, long third section of the last segment taken, is used as a reference,- That these segments are added to each other offset when the determined deviation is minimal and- That the relative error or the absolute quadratic error is used as a measure of the deviation. Verfahren zur Geschwindigkeitsmodifikation von Sprachsignalen, insbesondere digitalisierten Sprachsignalen, bei dem - ein analoges Sprachsignal digitalisiert wird, wodurch ein digitalisiertes Sprachsignal entsteht, welches in einem Speicher gespeichert wird,- ein Faktor α definiert wird, um welchen das Sprachsignal verlängert oder verkürzt wird,- eine Fensterfunktion mit einem ersten steigenden Abschnitt der Länge N, einem zweiten, sich direkt an den ersten Abschnitt anschließenden, konstanten Abschnitt der Länge L und einem dritten, sich direkt an den zweiten Abschnitt anschließenden, fallenden Abschnitt definiert wird, wobei bei einer Überlagerung des ersten steigenden Abschnittes eines Fensters mit dem dritten fallenden Abschnitt eines anderen Fensters und einer Addition beider Abschnitte im Überlappungsbereich, sich das Ergebnis eins ergibt, was dem Wert des zweiten Abschnittes der Fensterfunktion entspricht,- aus dem digitalisierten, gespeicherten Sprachsignal in unregelmäßigen Abständen einer mittleren Länge αL Segmente einer Länge L+N entnommen werden,- diese, aus dem digitalisierten, gespeicherten Sprachsignal entnommenen, Segmente mit der Fensterfunktion im Zeitbereich gewichtet werden,- die gewichteten Segmente jeweils um eine definierte Anzahl von L Abtastwerten versetzt aufaddiert werden, wodurch das so entstehende Sprachsignal um den Faktor α verlängert bzw. um 1/α verkürzt wird, dadurch gekennzeichnet,- daß nacheinander an den Stellen der Entnahme der Segmente aus dem digitalisierten Sprachsignal, das dort entnommene Segment mit dem Resultat der Synthese mit dem nachfolgend entnommenen Segment verglichen wird,- daß zum schnellen Vergleich der Abweichung des jeweiligen Syntheseresultats vom Originalsignal lediglich der N Werte lange dritte Abschnitt des zuletzt entnommenen Segmentes als Referenz herangezogen wird,- daß diese Segmente zueinander versetzt aufaddiert werden, wenn die ermittelte Abweichung minimal ist und- daß als Maß für die Abweichung der relative Fehler oder der absolute quadratische Fehler herangezogen wird.